涌现能力」共找到 3246 篇相关文章

算法论文8

为防AI刷题,Nature等顶刊最新封面被做成数据集,考验模型科学推理能力|上海交通大学

上海交通大学王德泉教授课题组提出MAC基准,用顶级期刊最新封面构建测试集,评测多模态大模型能力。研究设计两种含“语义陷阱”的测试任务,发现顶尖模型有局限,还提出DAD方法提升表现,采用双重动态机制。

量子位
算法论文8

监督学习未死,一题训练五小时起飞!华人学者新方法20倍训练效率释放大模型推理能力

大模型推理能力研究中,RL训练资源成本高、不稳定,传统SFT低数据量易过拟合。加拿大滑铁卢大学华人团队提出One - Shot CFT方法,用一题多解多点评训练,仅需约5个GPU小时,效果好、稳定性强。

量子位
开源动态8

o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界

GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。

AI科技评论
算法论文8

Coding Agent 自主解题很强,但用户改一行代码就"翻车"?自所团队提出 SWE-Touch 揭示共享工作空间下的能力缺口

当前基于大模型的Coding Agent是热门研究方向,现有评测多假设其独占代码仓库。中科院自动化所团队构建SWE - Touch框架,对9个前沿模型测试,发现用户干预下模型性能下降、排名洗牌。

深度学习自然语言处理
产品应用8

π0.7的泛化能力有多强?零样本纯靠口述就能用空气炸锅,演示完换个机械臂也能叠衣服

2026年4月16日,美国明星机器人AI公司Physical Intelligence发布模型π0.7。它具组合泛化能力,借助多模态提示框架,能零样本完成新任务。在空气炸锅、叠衣服等实验中表现出色,有望推动具身智能发展。

DeepTech深科技
新闻资讯8

The Batch:835 | 图表中的 AI 市场趋势

知名投资分析师 Mary Meeker 时隔六年发布 340 页 AI 市场报告。报告指出 AI 变革快、性能攀升、有新兴能力,还会影响劳动力等,同时也带来经济不确定性,当下是开发软件应用的黄金时期。

DeeplearningAI
算法论文8

LLM 竟然会内省!Anthropic 整了个大活:首次揭开 AI 意识

Anthropic最新研究《大语言模型中涌现的内省意识》,首次通过直接操控模型内部状态验证AI能否觉察自己思想。研究采用概念注入技术,发现AI有内省能力,且不同模型表现有差异。

PaperAgent
产品应用8

大模型首次打破围棋思维「黑盒」,打通科学发现新路径!上海AI Lab发布新一代InternThinker

上海AI Lab发布新一代书生·思客(InternThinker),它是我国首个具围棋专业水平且能展示透明思维链的大模型。其得益于InternBootcamp训练环境,还在多任务混合训练中现‘涌现时刻’,背后有通专融合底层技术突破。

量子位
开源动态8

Agentic Coding表现创新高,全新KAT系列模型强势霸榜SWE-Bench

快手 Kwaipilot 团队推出 KAT 系列两款 Agentic Coding 大模型,KAT - Dev - 32B 开源,KAT - Coder 闭源。两模型在 SWE - Bench Verified 表现出色,且在多训练阶段创新优化,有强大代码生成能力涌现现象。

机器之心
产品应用8

没想到 50 岁了我开始手搓小游戏:灵光闪现

作者池建强分享AI领域“生成涌现”现象,以Gemini 3.0演示为例,又介绍蚂蚁集团的灵光App,其闪游戏功能让普通用户用一句话生成小游戏,能修改迭代,体现AI构建系统能力,创作平权或到来。

MacTalk