「智能体基准」共找到 4125 篇相关文章
人生教练团Agent v2.0!给你省下万元咨询费(内有详细教程)
作者打造“人生教练Agent 2.0”,将马斯克、查理·芒格等大神“塞进”电脑。它有AI主持人,能根据问题召集合适导师。还介绍使用流程,灵感源于AIasMe等,后续会教加记忆功能。
ThinkChain:一个让Claude边调用工具边思考的开源框架
ThinkChain是展示Claude高级能力的Python项目,其核心创新是将工具执行结果注入Claude思维流,改变AI与工具交互方式。它支持零配置启动,有丰富工具集,还具备交互式命令等特性。
扎克伯格炮轰苹果缺乏创新,并千万美金年薪狂招AI 人才
Meta为组建「超级智能」团队,开出超1000万美元年薪,扎克伯格亲自下场。还计划148亿美元收购Scale AI 49%股权。此外,扎克伯格炮轰苹果缺乏创新,业界对此看法不一。
又一个开源 AI Agent 杀到!II-Agent,号称“全球最强”,击败 Genspark 和 Manus,跑分直逼人类
AI Agent 赛道迎来新成员 II-Agent,由 Intelligent Internet 团队打造且将开源,获前 Stability AI CEO 站台。它性能强、可扩展,GAIA 跑分亮眼,团队认为未来是 Agent 群的天下,还计划为多领域构建开源 Agent。
上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”
上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。
EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?
随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。
中科院自动化所孵化的矿山物理AI龙头,国家队与产业资本为何集体重仓|甲子光年
2026年物理AI热度攀升,概念也趋于泛化,产业和资本更关注其实际价值。矿山场景或成Physical AI首个盈利点。中科慧拓由中科院自动化所孵化,其平行矿山方案已落地近50座国内矿山,并实现海外项目落地。
360 周鸿祎:做中国版 Mythos 不能照搬美国路线,基模能力的差距可以通过Harness补齐
过去几月,Anthropic的Mythos模型成全球网络安全焦点。360周鸿祎在ISC.AI 2026上发布‘图龙锋’和‘仪天阵’,欲做中国版Mythos,还发起‘磐石之盾’计划。他认为不能照搬美国路线,可通过Harness弥补基模差距。
微软 SkillOpt:不动模型权重,只训练那份「技能说明书」
微软研究院 Yifan Yang 等人推出 SkillOpt,思路反直觉,不动模型权重,把「技能文档」当可训练参数。它在 52 个组合中表现最优,技能可迁移,代码已开源,还支持多操作。
Anthropic首次揭秘下一代Claude怎么造!用户吐槽直接喂模型,连AI“做梦”都被训练
Anthropic研究团队产品经理Alex在访谈中透露Claude演进方向,如将模型开发产品化、向“持续运行Agent”演化,还解释“dreaming”机制等,也提及训练“人格”、研究意识等,展现了长远思考。