「SWE - bench」共找到 164 篇相关文章
claude 4摔碎了码农的饭碗~
昨晚Anthropic发布Claude 4系列模型,Opus 4编码能力强,SWE - bench测试成绩优,能完成7小时代码重构。Claude 4让完成日级任务的时间提前,各应用纷纷接入,部分产品有应对策略。
马斯克首个编码模型上线,编程飙进Top5!这9位华人天团爆肝打造
xAI上线首个编码模型Grok Code Fast 1,速度快且性价比高,在编程基准测试中冲进前五。它全栈开发能力出色,背后核心团队华人学者占多半,xAI还给出提示词编写指南。
500行极简开源框架,硬刚GPT/Gemini视觉极限!
多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI构建SWE-Vision框架,让模型用代码处理视觉判断,在五个视觉基准测试达最优,其极简设计有效且泛化性强,代码已开源。
浙大联手字节:开源大规模指令跟随视频编辑数据集OpenVE-3M
浙江大学与字节跳动合作,提出大规模指令跟随视频编辑数据集 OpenVE-3M,有 3M 样本对。还提出数据构造管线、编辑模型 OpenVE-Edit 及评测集 OpenVE-Bench,小参数量下超越现有开源模型。
Auto-Research「终极大考」:新基准撕下大模型科研伪装
来自多所高校的研究者提出MLS - Bench,用于解决现有Auto - Research评测的归因问题。它含140个真实研究任务,校准受控修改范围,主实验显示当前模型在方法发现上有明显缺口,Auto - Research需更严格评测标准。
大模型玩不好数独?!Transformer作者初创公司公布排行榜:o3 Mini High“变异数独”正确率仅2.9%
Transformer作者初创公司Sakana AI公布AI解决数独能力排行榜,用全新基准Sudoku - Bench考验大模型创造性推理能力。结果显示大模型总体正确率仅15%,9×9数独中高性能模型o3 Mini High正确率2.9%。
ICML 2025 | 大模型能在信息不完备的情况下问出正确的问题吗?
当前大语言模型推理研究多聚焦被动推理,主动推理研究少,制约其在现实场景应用。为此提出 AR - Bench 基准评估大模型主动推理能力,实验显示大模型主动推理能力严重不足,并指出后续拓展方向。
首个地球科学智能体Earth-Agent来了,解锁地球观测数据分析新范式
上海人工智能实验室与中山大学联合研发的 Earth - Agent 解决了多模态大语言模型用于地球科学研究的痛点。它将领域知识工具封装化,利用 LLM 智能规划调度。经 Earth - Bench 评估,其在多方面表现出色,未来发展前景广阔。
最新外国「自研」大模型,都是套壳国产?
本周,Cursor发布新代码模型Composer,Cognition推出新AI模型SWE - 1.5,二者均被指背后基于中国AI模型。业界大佬认为有证据指向中国开源模型,国产开源模型已成AI领域主流,改变全球竞争格局。
都说记忆是Agent标配,但MemSyco发现漏算了一件事
厦门大学与吉林大学的最新研究指出,随着大模型Agent具备长期记忆,虽成为“长期协作者”,但也出现Memory-Induced Sycophancy问题。为此提出MemSyco - Bench评测基准,经实验得出多项发现,指出Agent Memory关键瓶颈转变。