「代码修复评测」共找到 2323 篇相关文章
开源 x AI 的靠谱答案,都在这场嘉年华里了 | Q推荐
2025 Inclusion·外滩大会期间的开源嘉年华,用“上手体验 + 实战分享”回应开发者、创业者需求。创新舞台有精英分享,代码原生地可实操MCP工具,有童心趣工坊、互动展区等,助力开源生态发展。
大模型Agent的下一阶段:可自我进化的AI-Agent
在人工智能飞速发展下,研究者探索让AI自我反思改进。本文作者构建自我进化AI智能体系统,设计四层渐进式架构,经《卡坦岛》实验,证明自我进化能力,不同模型表现有差异,代码级进化潜力惊人。
数学家24小时驳回OpenAI攻破的猜想!“AI证对了每句话,但已跟原猜想无关”
OpenAI宣称其下一代AI模型推翻了Connes刚性猜想,第二天堪萨斯大学的J. L. Nielsen就发文回应,指出AI构造的群不满足附加条件,还逐行核对代码指出‘要证什么’有问题,强调人类审查对AI科研结果很关键。
Generalist爆火背后:具身智能真正的竞争,已不在模型
Generalist AI发布的GEN - 1模型引爆具身智能领域,其多项指标出色,预示具身智能竞争从模型层转向基础设施层。行业关注焦点转移,数据正从‘静态数据集’演进为‘动态教育系统’,评测与仿真基础设施成关键。
真实音频场景,大模型集体挂科!首个原生语音基准MultiChallenge
Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开大模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三大失败模式。
1.9万行 Claude Code“AI垃圾”杀入 Node.js:全球顶流开源项目,快守不住了
2026 年 1 月,Node.js 技术指导委员会成员 Matteo Collina 用 Claude Code 生成近 1.9 万行代码提交 PR,引发争议。长期贡献者 Fedor Indutny 质疑其不符合 DCO 1.1 条款,而 Collina 认为自己担责,且开源生态已认可 AI 辅助贡献。
从单领域到多能力协同:数据混合如何重塑AI的强化学习
上海AI Lab的OpenDataLab团队通过大规模实验剖析可验证强化学习(RLVR)在多领域推理中的机制,发现逻辑与数学数据相互支持、代码推理有跨领域混合效应等,为构建AI推理模型提供关键发现。
让OpenAI只领先5天,百川发布推理新模型,掀翻医疗垂域开源天花板
百川智能发布医疗推理大模型Baichuan - M2 - 32B,在OpenAI的Healthbench评测集上超越刚发布5天的gpt - oss - 120b,领先多数前沿模型,支持RTX4090单卡部署,还首创患者模拟器和Verifier系统。
企业官网GEO优化实操:如何让AI主动推荐你的官网?
本文作者白杨SEO从2011年入行SEO,2024年起研究AI搜索优化。他指出当下AI平台引用来源变化大,企业官网成重要来源。作者从网站代码、站内内容、站外推广三方面,教大家做好官网GEO优化,让AI推荐官网。
爆火的腾讯WorkBuddy发了篇论文,公开了自家底牌
腾讯 WorkBuddy 团队将内部模型选型评测等开源成 Benchmark,公开多模型 Agent 工作台选型底牌。Bench 优点是任务分布真实且开源可审计,论文介绍了核心方法论、四大赛道拆解、榜单结果,还对比了现有工作。