「M3 - Bench」共找到 2259 篇相关文章
Claude不让我们用!国产平替能顶上吗?
全球AI代码生成竞争格局生变,Anthropic地位动摇,一是OpenAI GPT - 5崛起,二是自身迷之操作。此时国产大模型发力,如Kimi - K2 - 0905、Qwen3 - Max - Preview,性能和价格有优势,有望改变竞争格局。
孪生素数猜想被GPT-6新突破!北大数学07级又出现了
OpenAI发布数学论文,宣布GPT-6 Astra在孪生素数猜想上有新进展,用Lean形式化证明把连续素数间距的上界从246推到186。此外,其3D生成效果出色,Codex还新增可搜索笔记功能。
蚂蚁EGSS算法破解Test Time Scaling困局 | ACL 2026
蚂蚁集团CodeFuse团队在ACL 2026主会论文中提出EGSS算法,破解Test Time Scaling困局。该算法精准识别高不确定性决策点,解决计算冗余与选择脆弱问题,在SWE - Bench - Verified上全模型提升5 - 10%。
它石智航用“吉尼斯纪录”交卷真干活的具身大脑,丁文超:从来没有Plan B
它石智航在获巨额融资后埋头研发,其A1机器人创线束装配吉尼斯世界纪录。该公司打造具身大脑AWE 3.0,还推出SenseHub数采套件,发起具身数据星火计划,推动具身智能发展。
给GUI Agent装上「世界模型」:阿里通义用混合数据+统一思维链,让模型学会预判屏幕变化
伴随多模态大模型发展,GUI Agent成人机交互新范式,但构建高可用、跨平台的GUI Agent面临诸多挑战。阿里通义实验室开源Mobile - Agent - v3.5框架及GUI - Owl - 1.5模型家族,解决了相关技术壁垒。
阿里千问负责人林俊旸突然离职,Qwen 开源时代要变了吗?
3月4日凌晨,千问核心负责人林俊旸在X发文卸任,3月3日下午他已向阿里辞职。他在阿里大模型研发中贡献突出,推动Qwen3系列开源。外界猜测Qwen或转向闭源,其离职引发业内关注。
GPT-5编程成绩有猫腻!自删23道测试题,关键基准还是自己提的
有人发现OpenAI测试GPT-5编程能力时,用的SWE-bench Verified子集仅477题,自行省略23题。若这些题默认零分,其得分比Claude Opus 4.1低。且该基准还是OpenAI自己提出的。
太牛了~~复杂表格Cell合并、跨页拼接,中文领域96%,甩MonkeyOCR 20%
在PDF文档解析领域,复杂表格解析是难题。今天分享的OCRFlux是基于qwen2.5vl - 3B模型微调的解决方案,有单页解析和跨页段落/表格合并等创新点,测试得分超96%,远超MonkeyOCR等。
Transformer八子初创:AI横扫NP难题竞赛,Top 2%选手竟是智能体!
Transformer作者Llion Jones初创公司测试AI智能体,其在NP难题竞赛中排第21。Sakana AI与AtCoder合作构建ALE - Bench,设计ALE - Agent参赛成绩优异,不过它也有调试难等局限,未来待改进。
雷峰网现场直击:ICRA 2026下周在维也纳开幕,中国力量站上C位
6月1日,IEEE国际机器人与自动化会议(ICRA 2026)将在维也纳开幕。今年投稿量4947篇破纪录,86个国家参与,1882篇论文被录用。热门方向有VLA模型、Sim - to - Real、3D感知,中国研究者从投稿大国迈向规则定义者。