大模型Agent」共找到 10468 篇相关文章

算法论文8

清华孙茂松团队 × 深言科技:以解释作为训练信号,让 8B 模型在幻觉检测上反超闭源模型

语言模型幻觉问题待解,成本与算力需求攀升。清华孙茂松团队联合深言科技提出FaithLens模型,把幻觉检测提升为整体评估,以解释作为训练信号,8B模型在多任务上超闭源模型

AI科技评论
算法论文8

230个模型在婴幼儿认知题上集体翻车!揭秘多模态模型的核心知识缺陷

ICML 2025研究揭示多模态模型在基础认知能力上表现不佳。研究者建测评题库CoreCognition测试230个主流模型,发现其存在核心知识缺陷,扩规模难补短板,还需补齐核心知识。

量子位
推荐文章8

Evolvent AI 胡梦康:Agent 可能会被模型吃掉,但帮助 Agent 进化不会

Evolvent AI 创始人胡梦康认为 AI 下一阶段是让模型自主迭代。公司搭建 Self - Evolving Agent Infrastructure,希望成 Agent 进化的数据基础设施供应商。胡梦康分享研究历程、对 Agent 方向判断及公司业务,探讨 Agent 数据等问题。

Founder Park
算法论文7

模型的第一性原理:(三)信息论篇

本文从信息论角度解读模型第一性原理。介绍Shannon信息论,提出将其从以BIT为中心转换为以TOKEN为中心解释模型底层原理,还阐述模型各阶段信息论原理、定向信息计算方法,对比Granger与Pearl因果。

机器之心
开源动态8

企业级OpenClaw最强拍档来了!万亿参数的国产多模态模型,刚刚开源发布

YuanLab.ai团队开源源Yuan3.0 Ultra多模态基础模型,是万亿级开源多模态模型之一。它优化训练效率,在多任务表现突出,为企业Agent AI提供支撑,还提出新算法和训练策略,全面开源推动落地。

量子位
新闻资讯8

从MiniMax到DeepSeek:为何头部模型都在押注「交错思维」?

昨日推特博主公布国内几开源模型在 mini - SWE - agent 测试成绩,MiniMax 新一代模型 M2 表现最佳。其采用的「交错思维」技术成亮点,解决了状态漂移问题,正成高性能 Agent 模型标配。M2 既强又省,还给出使用最佳实践。

机器之心
算法论文8

模型作为!微博的VibeThinker-1.5B超越DeepSeek R1等头部模型

近年来,“参数越,能力越强”成行业共识,但带来成本高和资源集中问题。微博AI团队开发的VibeThinker - 1.5B用1.5亿参数和低训练成本,在多项测试中超越头部模型,还提出SSP框架和MGPO算法。

深度学习自然语言处理
算法论文7

模型在具身推理上「翻车」了?4496 道题全面揭示短板

美国东北学等提出BEAR基准评估MLLM具身智能子能力,用4496道题测试20个模型。发现多模态模型具身能力不足,还分析错因,开发BEAR - Agent提升模型具身推理能力,在仿真测试中效果显著。

机器之心
新闻资讯7

全球开源模型,前十五名全是中国的

近日,随着新一代语言模型更新,开源模型成热门话题。Design Arena排行榜上,若设定为“开源”,前15名均为国产开源模型,排名第一的是DeepSeek - R1 - 0528 ,智谱、阿里等厂商多款模型上榜。

机器之心
推荐文章7

C端热战,B端暗涌:模型真正的战场才刚刚开始 | 《中国模型落地应用研究报告 2025》正式发布

InfoQ研究中心联合中欧AI与管理创新研究中心发布《中国模型落地应用研究报告2025》,从驱动因素、C端产品现状到B端落地现状,勾勒模型应用转折期的图景,分析应用难的原因及各端现状。

InfoQ