「代码强化学习」共找到 2984 篇相关文章
80%代码由Claude合并,Anthropic内部人员点破Agent真相:「Close the Loop」
Anthropic团队研究产品经理Theo演讲指出,Claude已深入其工程流程,超80%代码由它合并。模型角色转变,能力提升,失败率下降。开发者应升级研发战术,如刷新评估基准、精简“脚手架”、闭环设计。
60个量子比特顶百万倍内存:量子机器学习找到新的突破口
4月8日,加州理工学院等联合团队在arXiv发布论文,证明小型量子计算机处理部分机器学习任务时,可用指数级更少内存超越经典计算机。研究绕开QRAM,提出算法框架验证优势,但仍待真实硬件验证。
吴恩达年度AI总结来了!附带一份软件开发学习小tips
AI大神吴恩达总结2025热门AI趋势,包括模型推理成标配、Meta引发人才争夺战、数据中心火热、智能体编程重塑软件开发。还给出软件开发学习建议,如参加课程、动手实践、读论文。
3000行代码长出无限技能:AI Agent自我进化时代来了
4月17日GitHub Trending上,Evolver和GenericAgent两个“自我进化”Agent框架登上热榜。Evolver用“基因进化”让提示词自动升级,GenericAgent以3000行种子代码长出独有技能树,二者代表不同进化范式。
代码采纳率如何提升至50%?AI 自动编写单元测试实践总结
文章围绕借助Aone Copilot Agent提升AI代码采纳率至50%展开,介绍项目背景、实践方案、执行过程等,阐述Prompt规则生成方法,分析核心价值与效果,总结经验教训,展望未来技术演进和团队能力建设方向。
华为推出软工代码智能体SWE-Lego,解锁SFT训练极致性能
华为研究团队推出仅基于监督微调(SFT)的软件工程代码智能体SWE-Lego,无需复杂RL流程,在SWE-bench Verified基准中表现出色,项目已开源。它有数据、训练和测试时扩展三大创新。
AI 代码审查再进化:AutoDev 多智能体协作架构深度解析
现代软件开发中,代码审查存在信息割裂、人工效率低等痛点。AutoDev 借助多智能体协作与信息聚合,实现从分析到修复的闭环智能流程,还构建多 Agent 协作体系,未来将集成更多能力。
当SFT遇上RL:基于样本学习阶段的动态策略优化机制
在大模型推理能力增强研究中,SFT和RL两种后训练范式难有效融合。研究团队提出DYPO动态策略优化方法,先判断样本学习阶段再匹配优化路径,在多场景实验中表现出色,不过有实验边界。
每天上线一个新系统,这款腾讯自用低代码有什么不同
腾讯自用低代码平台无极,平均每天上线1.2个新系统,用户覆盖1/3员工。它去模板化,从数据结构设计开始,数据推导UI,有灵活编辑器,支持渐进式开发,具备集成性和开放性,还有AI赋能。
LSTM之父向何恺明开炮:我学生才是残差学习奠基人
LSTM之父Jürgen Schmidhuber替学生Sepp Hochreiter发声,称残差学习30年前已诞生,1991年Sepp就用循环残差连接解决梯度消失问题,为残差思想奠基。他觉得将成果全归何恺明团队有失偏颇。