专家级表现」共找到 3397 篇相关文章

算法论文8

ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示大模型如何“踩雷”领域指南规则

这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示多数主流大模型指令遵循能力不佳,尤其数学推理挑战大,为模型迭代提供评估基准。

深度学习自然语言处理
推荐文章7

快速行动,创造未来:AI时代的职业新法则——LinkedIn联合创始人给即将踏入AI时代职场的毕业生一些忠告

LinkedIn联合创始人Reid Hoffman给即将踏入AI时代职场的毕业生忠告。虽就业形势严峻,但毕业生应兴奋,主动驾驭AI,用其优化职业,具备AI素养,发挥主动性,重视人际关系,创造未来。

宝玉AI
推荐文章8

深度对话 Benchmark 合伙人:AI 打破了 SaaS 的 3322 规则改变创造本质

Benchmark 合伙人 Eric Vishria 与 Banana Capital 合伙人 Turner Novak 对话,分享 AI 时代创业看法、投资策略等。他认为 AI 打破 SaaS 增长法则,关注创始人叙事、学习能力,坚持投资非凡公司,还谈了对上市、估值等的观点。

投资实习所
新闻资讯7

硅谷AI圈变天!OpenAI弃微软转投谷歌,LeCun被边缘小扎组队血战复仇

OpenAI抛弃微软,与谷歌达成云服务协议,重塑AI竞争格局。Meta的Llama 4表现不佳,扎克伯格亲自组队50人,斥资150亿收购Scale AI,誓要做出AGI,硅谷AI圈风云骤变。

新智元
推荐文章7

MCP很好,但它不是万灵药!真正的技术进步,往往始于祛魅之后的清醒认知

当下AI领域,MCP热度高涨,但它并非万能。文章剖析MCP本质,指出它是统一工具调用协议,与Function Call合作。同时分析其开发难题与市场乱局,强调要理性看待,明确其定位和边界,发挥潜力。

腾讯技术工程
算法论文8

扩散语言模型扛把子LLaDA迎来新版本,数学、代码、对齐能力均提升

中国人民大学与蚂蚁集团团队基于前期 8B 扩散语言模型 LLaDA,提出方差缩减的偏好优化方法 VRPO,推出 LLaDA 1.5。它在数学、代码、对齐任务上性能提升,VRPO 为扩散语言模型对齐提供框架。

机器之心
算法论文7

多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品

现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。

量子位
算法论文8

真实联网搜索Agent,7B媲美满血R1,华为盘古DeepDiver给出开域信息获取新解法

华为诺亚方舟实验室提出 Pangu DeepDiver 模型,实现 LLM 搜索引擎自主交互新范式。它用真实互联网数据训练,在 WebPuzzle 等基准测试中,7B 的 DeepDiver 媲美 671B DeepSeek - R1,展现强大信息获取与泛化能力。

机器之心
算法论文8

让AI像人类一样认知真实世界!UCLA谷歌强强联手,长时记忆+3D空间理解超越基线16.5%

如何让AI在3D环境中像人类一样思考,是具身智能领域难题。UCLA与谷歌团队带来3DLLM - MEM模型与3DMEM - BENCH基准,让AI有构建、维护和利用长时记忆能力,实验超基线16.5%,但有依赖模拟器预设的局限。

量子位
新闻资讯7

大模型玩不好数独?!Transformer作者初创公司公布排行榜:o3 Mini High“变异数独”正确率仅2.9%

Transformer作者初创公司Sakana AI公布AI解决数独能力排行榜,用全新基准Sudoku - Bench考验大模型创造性推理能力。结果显示大模型总体正确率仅15%,9×9数独中高性能模型o3 Mini High正确率2.9%。

量子位