代码生成」共找到 3529 篇相关文章

算法论文8

Auto-Research「终极大考」:新基准撕下大模型科研伪装

来自多所高校的研究者提出MLS - Bench,用于解决现有Auto - Research评测的归因问题。它含140个真实研究任务,校准受控修改范围,主实验显示当前模型在方法发现上有明显缺口,Auto - Research需更严格评测标准。

机器之心
算法论文7

从 RLVR 到 RLSVR:开放式任务如何获得可核验奖励

COLM 2026 论文提出 RLSVR 及 SpyRL,把摘要等开放任务变成“谁是卧底”游戏,用投票生成可核验奖励,在多任务有提升,但也暴露代理目标与质量关系、成本等问题。

深度学习自然语言处理
开源动态8

泪崩!!!完啦,完啦 AI 编程,4k Star MonkeyCode!!!

现在很多AI编程工具,只让Agent“写出代码”。而MonkeyCode把AI编程任务接入完整链路,是面向专业研发团队的开源AI开发平台,本文介绍其特点、适用场景及注意事项。

小华同学ai
新闻资讯7

AI批量轰炸苹果bug赏金计划,审核团队已下线

苹果bug赏金计划因AI冲击设冷静期,业余选手用ChatGPT批量找漏洞,让审核团队分身乏术。同时,苹果最强防御系统被AI攻破,不过防御者也能用AI工具,苹果首次在安全修复中致谢AI。

量子位
算法论文8

竞赛编程Agent进入全球前十!南大、清华新模型CF rating超3500

大语言模型在竞赛编程场景易失败。南大、清华等研究者提出Solvita框架,由四个角色形成闭环,构建可训练图结构知识网络积累经验。实验显示其在多评测中表现强,提升不靠增加token。

新智元
开源动态7

Headroom:Netflix 工程师开源的上下文压缩工具,省 token 还是烧 token?

Netflix工程师Tejas Chopra开源Headroom,定位为AI Agent的上下文压缩层,压缩工具输出等内容,有可逆压缩等特性。官方数据显示节省token效果好,但微软工程师实测结果中性偏负面。

AI工程化
产品应用7

豆包收费版第一天,我:充值…又得充值?我要再充值!

豆包开启付费模式,有三档收费标准,学生还有专属优惠。实测发现,付费版体验成熟,办公任务模式友好,但额度消耗快。文章还给出不同人群适合的档位建议。

量子位
产品应用7

Claude Code 修了几个小 bug,却揭开了 Agent 落地的大麻烦

Anthropic给Claude Code发的更新,看似是修小bug,实则指向AI编程产品正从“模型会不会写代码”转向“Agent能否稳定完成任务”,暴露了工具状态、权限边界等执行问题。

AI科技评论
新闻资讯8

40万次Claude Code会话实锤:这才是AI时代最值钱的本事!

Anthropic用40万次Claude Code会话数据得出结论,决定AI编程成败的不是代码功底,而是对行业的理解。人决定造什么,AI决定怎么造,懂行的人能从AI榨出几倍产能。

新智元
新闻资讯7

GPT-5.5反杀Claude登顶,AI编码旧榜不准了?

Datacurve推出新基准DeepSWE,号称「零污染」,用113道原创题挑战旧编程榜单。它使GPT和Claude名次逆转,揭示旧基准验证误差大、存在作弊现象,虽有局限,但反映编程基准竞争转向抗污染和验证可信。

新智元