「SWE基准测试」共找到 2081 篇相关文章
阿里智能体多轮推理超越GPT-4o,开源模型也能做Deep Research
通义实验室推出自主信息检索智能体WebDancer,其通过系统化训练范式为构建智能体提供路径,也为在开源模型上复现Deep Research系统提供指导。它在多数据集测试中表现出色,团队还对其未来应用做了展望。
突袭Cursor,Windsurf抢发自研大模型!性能比肩Claude 3.5、但成本更低,网友好评:响应快、不废话
当地时间5月16日,Windsurf推出首个AI软件工程模型家族SWE - 1,含三款模型,性能比肩Claude 3.5且成本更低。开发者试用评价不错,但也指出不足。Windsurf称旨在提升软件开发速度,还介绍了测评、编辑器赋能等情况。
机器人进入“边做边学”时代:星尘发布在线强化学习框架,让动态投掷成功率提升超141%
星尘智能基座模型团队公布在线强化学习框架SmoothRL,解决异步执行环境中具身模型在线微调难题。该框架让策略更新对应硬件实际执行,攻克延迟失准问题,在多项真机测试中大幅提升任务成功率。
一个「流浪」数学家的遗产,正在被AI公司疯抢
2026年,OpenAI等公司用AI解决多个匈牙利数学家Paul Erdős提出的问题,震动数学界。这些问题分布广、难度跨度大,适合模型测试。不过,AI证明的验证和人类数学家地位受关注。
提前实测Opus 5:3D细节封神,然而有一个致命缺陷
全网苦等Opus 5,结果其暂缓发布,理由是怕威胁人类对高级AI的控制,遭网友怒批。部分开发者提前实测,它3D细节表现出色,但耗token且看图测试翻车,原定有诸多强大特性。
谢赛宁盛赞字节Seed新研究!单Transformer搞定任意视图3D重建
字节Seed康炳易团队的最新研究成果Depth Anything 3(DA3),获谢赛宁盛赞。它架构简单,能从多种输入中精准算出物体深度、还原相机位置,在新视觉几何基准上表现出色,核心秘诀是极简设计。
可灵2.5Turbo实测|顶尖AI视频模型,真能打平CG吗?
可灵发布2.5 Turbo版本视频模型,进步显著,提示词理解、高速动态表现、风格稳定性都有提升,价格还更划算。经多场景测试,其在特定场景下内容质量能与CG媲美,开始理解动作背后逻辑。
谷歌发布Nano Banana官方保姆级开发教程,代码给你喂到嘴边
谷歌为Nano Banana新模型发布官方保姆级开发教程。介绍了使用Google AI Studio免费测试方法,阐述环境准备,如获取API key、设置结算账户、安装Gen AI SDK,还展示代码实战,以及和模型沟通的技巧。
蚂蚁EGSS算法破解Test Time Scaling困局 | ACL 2026
蚂蚁集团CodeFuse团队在ACL 2026主会论文中提出EGSS算法,破解Test Time Scaling困局。该算法精准识别高不确定性决策点,解决计算冗余与选择脆弱问题,在SWE - Bench - Verified上全模型提升5 - 10%。
英伟达巧用8B模型秒掉GPT-5,开源了
英伟达携手港大开源Orchestrator-8B小模型,在HLE测试中分数超GPT - 5,成本低且速度快。它靠ToolOrchestra训练法,协调工具解题。此赛道已有多项研究,小模型实用优势明显。