Frontier-Eng Bench」共找到 155 篇相关文章

新闻资讯7

会挖0-day漏洞!凶残版Claude官宣却不让用,微软苹果齐下场“看守”,Anthropic到底在图什么?

Anthropic官宣Mythos Preview,却未将其放给普通人用,而是塞进防御联盟Glasswing。Mythos在漏洞发现和利用上能力超多数人类,Anthropic怕其引发风险,先将它组织进防守体系,还试图占据‘负责任的frontier lab’位置。

AI科技大本营
产品应用8

AI Coding新王登场!MiniMax M2.1拿下多语言编程SOTA

MiniMax发布旗舰级Coding & Agent模型M2.1,在Multi - SWE - bench榜单中以10B激活参数拿下49.4%成绩,超越竞品成SOTA。它解决模型‘偏科’问题,适配开发工具链,实测在多语言编程任务中表现出色。

量子位
开源动态8

登顶!快手发布开源编程模型,720亿参数,创下编程能力新纪录

快手发布开源编程模型KAT-Dev-72B-Exp,在SWE-Bench Verified测试中登顶开源代码模型,与闭源GPT - 5成绩相近。该模型基于自研框架,有架构创新,还集成多种软件工程能力,是构建编程智能体的有力工具。

AIGC开放社区
开源动态7

24B模型编程超DeepSeek全家桶,32G内存苹果电脑就能跑,专门针对真实GitHub Issue训练

Mistral发布最新开源编程模型Devstral,参数24B,能在单卡RTX4090甚至32G内存Mac上运行。它专为编程智能体推出,针对真实GitHub Issue训练,在SWE - Bench Verified测试中表现出色,还可与All Hands AI框架配合。

量子位
产品应用8

Agent大革命!Claude 4连续自动编程7小时,刷新世界记录

今天凌晨Anthropic召开开发者大会,发布Claude 4,含Opus 4和Sonnet 4。Opus 4编程智能体连续工作7小时破纪录,Sonnet 4在SWE - bench表现超前沿模型。还新增功能,Claude Code开放,API也有新特性,Sonnet 4免费但有限制。

AIGC开放社区
上一页16 / 16下一页