「Aider编程基准」共找到 1889 篇相关文章
“最强编码模型”上线,Claude 核心工程师独家爆料:年底可全天候工作,DeepSeek不算前沿
Anthropic 开发者大会发布 Claude 4 ,含 Opus 4 和 Sonnet 4 型号,在基准测试表现出色。核心工程师预测年底软件工程智能体能力,谈 RL 及 DeepSeek,还提到模型自我意识、推理计算瓶颈等问题。
突发!Opus 5.1被曝本周发布,最强AI智能体恐大洗牌
消息称Anthropic本周将发布Opus 5.1,其升级聚焦单Token智能水平,强化编程、推理、AI Agent能力;OpenAI 10万亿参数模型Bel完成预训练;企业选模型‘够用就好’,Anthropic Fable 5份额低。
坚决不用行业标准AGENTS.md,Claude Code惹来“封杀令”:Anthropic终于回应了,但开发者更气了
当所有AI编程工具向行业标准靠拢时,Anthropic的Claude Code拒绝支持AGENTS.md格式,引发Shopify CEO公开威胁。开发者多次要求其支持该格式无果,Anthropic回应未让开发者满意,引发争议升级。
Claude一举扫清2000阶以下哈达玛矩阵!AI开始清空数学“待解列表”
Anthropic研究员携手Claude做出668阶哈达玛矩阵,解决该问题。此问题曾难倒人类数学家30年,被收录进FrontierMath基准测试。此次还扫清2000阶以下所有悬而未决的哈达玛矩阵阶数。
OpenAI搬空Claude Code!用户家当一键进Codex,唯独带不走Claude
AI编程大战中,OpenAI盯上对手用户的配置、技能等“家当”。8月11日其统一外部智能体导入说明,可将Claude Code等工具配置等搬入Codex,但只能进不能出,且部分内容无法迁移。
马斯克4000亿布局Agent :杀死 Cursor,Bot 有什么绝招?
马斯克花600亿美金买下AI编程产品Cursor俩月后,SpaceXAI发布Grok Bot。它定位特殊、可跨应用操作等,亮点是多智能体云端协作,但产品力与生态有差距,定价高端。
80%代码由Claude合并,Anthropic内部人员点破Agent真相:「Close the Loop」
Anthropic团队研究产品经理Theo演讲指出,Claude已深入其工程流程,超80%代码由它合并。模型角色转变,能力提升,失败率下降。开发者应升级研发战术,如刷新评估基准、精简“脚手架”、闭环设计。
DeepSeek V4还能更省!新工具缓存命中率高达99.82%,2折稳定到手
DeepSeek V4系列发布1个月,官方永久降价,开源社区的Reasonix项目将缓存命中率干到99.82%,能大幅降低成本。它专为DeepSeek打造,实现思路基于其缓存机制,安装使用简单。
李建忠对话菲尔兹奖得主Timothy Gowers:整个数学研究的范式将被AI改变
奇点智能研究院院长李建忠与菲尔兹奖得主Timothy Gowers对话,探讨AI与数学研究的十个话题,涉及数学重塑AI、AI推理能力、自动形式化、数学研究未来及AI对数学教育的影响等。
哈萨比斯出的难题,GPT之父接上了:用一个知识停在1930年的模型
GPT之父Alec Radford等用1931年前数据训练13B模型Talkie,切断现代知识污染。研究者测试其能力,探讨它对未来的“预感”、规避污染问题及数据多样性等,同时训练中也面临时间泄漏、数据质量等难题。