「智能体基准」共找到 4142 篇相关文章
刚刚,LMArena最新模型榜单出炉!DeepSeek-R1网页编程能力赶超了Claude Opus 4
LMArena最新模型榜单出炉,DeepSeek - R1(0528)表现亮眼。在文本基准测试中整体排第6、开放模型中排第一,细分领域也成绩优异,在WebDev Arena平台与闭源大模型并列第一,超Claude Opus 4。
对谈 DeepSeek-Prover 核心作者辛华剑:Multi Agent 天然适合形式化数学 |Best Minds
文章是对 DeepSeek-Prover 核心作者辛华剑的访谈。他认为强化学习是 AGI 关键解法,Multi Agent 适合形式化数学。还探讨了 DeepSeek Prover 进展、数学与 AGI 关系、评测基准等,指出未来有全才模型和自主 Agent 出现。
AI七个月突破数学家“围剿”反超人类!14位数学家深挖原始推理token:不靠死记硬背靠直觉
大模型o3 - mini - high在7个月内,于FrontierMath基准测试中,答题得分从2%提升到22%,超人类团队平均水平。数学家分析其推理记录,发现它靠直觉而非死记硬背解题,但也存在缺乏创造力等局限。
谷歌突袭发布AI应用,无需Wi-Fi、手机就能跑大模型!网友实测两极分化
谷歌推出 Google AI Edge Gallery 应用,可在 Android 设备离线运行 AI 模型。它有本地运行、智能选模等特点,响应快且隐私性好。不过网友实测评价不一,有人认为它是旧技术包装,还被指比 Core ML 落后。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。
全球唯一非侵入穿颅读脑突破!这家中国公司想成为脑科学的“英伟达”
当前脑机接口领域,侵入式危险、非侵入式分辨率低,深圳鲲为公司另辟蹊径,基于声学空间智能理论,用低频超声+算力算法实现全球首个非侵入高分辨率穿颅读脑,已商业化落地,目标成为脑科学领域的"英伟达"。
2026年了,我们还在用爱迪生试灯丝的方式评估World Model
文章围绕World model展开深度讨论,界定其概念,分析生成派、JEPA派、空间智能派三条技术路线,指出评估比LLM难,提及游戏化benchmark可能是破局点,还强调具身进展由数据驱动,Ego - View或为泛化关键。
小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek
小米开源 MiMo-V2.5 和 MiMo-V2.5-Pro 两款模型,采用 MIT 协议,适合商业应用。在基准测试中表现出色,有竞争力价格和限时优惠。但与 DeepSeek 比,架构创新偏工程化,也有推理表现不足等问题。
马斯克“开大”,600亿重金收购Cursor
SpaceX 宣布将以 600 亿美元收购代码生成初创公司 Cursor,或支付 100 亿美元合作。此前 xAI 编程项目落后,3 月挖角 Cursor 核心人员。Cursor 受竞争压力且缺算力,合作有望提升模型智能水平。交易或影响 SpaceX IPO 估值。
实战案例|当本体遇上 Agent:让 AI 真正“听懂业务”并“按规矩办事”【上】
本文是“企业级本体应用”系列第三篇,探讨本体如何融入企业智能体系统。指出本体非数据库或图谱,是语义层。介绍本体在Agent系统的架构与职责,通过案例展示用本体做规则判断和多维归类,凸显其优势。