五级能力论文」共找到 3995 篇相关文章

算法论文7

多模态模型具备“物理推理能力”了吗?新基准揭示:表现最好的GPT-o4 mini也远不及人类!

来自多机构研究人员构建PhyX基准测试,评估多模态模型物理推理能力。测试显示,即便表现最佳的GPT - o4 mini准确率仅45.8%,远不及人类的75.6%,且模型在多方面存在结构性缺陷。

量子位
算法论文8

AI玩宝可梦找出30年前代码Bug!谷歌论文介绍AI通关全过程,复杂任务都能解

谷歌Gemini 2.5系列技术报告花长篇幅介绍Gemini 2.5 Pro玩《宝可梦蓝》,它通关游戏,展现出创造力与长期规划能力,还发现游戏代码Bug,但也有幻觉、思维定势等问题。Claude 4已加入比赛。

量子位
产品应用8

数学奥赛高分摘金,位列大模型榜首,『书生』科学多模态大模型Intern-S1能力再升级 | 通专融合新进展

2025年CMO决赛首设AI测试,书生科学多模态大模型Intern-S1以102分位列大模型得分榜首,远超金牌线和国家集训队入选线。其推理能力提升得益于多项创新,未来将拓展至多领域科研。

OpenMMLab
开源动态8

o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界

GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。

AI科技评论
算法论文8

年度AI论文!全球三大顶尖模型的防蒸馏机制全面告破:小模型“套出”大模型隐藏思维链,Kimi-K3重现概率异常

这篇论文指出三大前沿AI模型厂商API有密码学旁路漏洞,攻击者用轻量级模型就能恢复大模型隐藏思维链数据。还揭示部分模型训练或借鉴大模型思维链,此漏洞也致企业数据隐私安全问题。

AI前线
算法论文8

Agentic的风又吹到了世界模型~

这篇42位作者联合完成、综述400余篇工作的论文,第一次用'能力×法则'双轴框架,把所有叫'世界模型'的系统放到同一张地图上,为领域建立公共语言,还得出了关键结论。

PaperAgent
算法论文7

近期,不错的LLM Agent统一记忆框架综述~

随着GPT、Qwen、Claude等大模型能力提升,LLM-based Agent走向长期任务。论文提出统一框架拆解Agent Memory为四组件,围绕两个数据集复现比较10个方法,还设计出新的低token开销框架。

PaperAgent
算法论文8

让大模型学会「心灵感应」:基于思维沟通的多智能体合作范式来了

NeurIPS 2025的论文提出思维沟通概念,建立潜在思维可识别性理论,构建ThoughtComm框架。该框架让模型共享潜在思维,跳过语言冗余歧义,实验显示其提升了协作效率与推理能力,或开启新智能形态。

机器之心
算法论文8

迈向无缝共生:大模型GUI Agent的「屏幕图灵测试」与拟人化之路

多模态大模型使GUI Agent能模拟用户执行任务,但也引发与平台的利益冲突。论文提出“屏幕图灵测试”和AHB基准评估拟人化能力,探讨拟人化策略及权衡,为Agent在数字世界共生提供指南。

AI科技评论
算法论文8

EMNLP2025 | LLM多次回答一致就一定正确吗?非也

随着LLMs在高风险领域广泛应用,其输出的事实性错误引发安全质疑。中科院计算所和美团团队论文揭示自我一致错误,传统检测方法对此失效,提出跨模型探针法提升检测能力

深度学习自然语言处理