扩散式大语言模型」共找到 7987 篇相关文章

算法论文8

RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈

大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。

深度学习自然语言处理
算法论文8

SIGIR 2025 | 解决扩展和迁移难题,华为新加坡提出InstructRAG,提升高达19%

语言模型任务规划面临可扩展性和可迁移性挑战,华为新加坡团队提出 InstructRAG 方案,通过多智能体协同架构实现指令图扩展与少样本任务迁移,在多数据集测试中性能提升高达 19.2%。

机器之心
新闻资讯8

谷歌Nature震撼发文,Gemini教练暴打专家!医学双料冠军,秒出睡眠报告

谷歌DeepMind把Gemini版大模型PH - LLM调教成「AI健康私教」,将可穿戴设备数据转化为睡眠健身建议,准确率超人类医生。它经两阶段训练,在多项测试中表现优异,或开启预防医学未来。

新智元
算法论文8

告别微调!腾讯提出Training-Free GRPO:无需更新参数,还能保证泛化性,成为传统RL的有力替代

大型语言模型在专业领域表现不佳,传统微调方法成本高、易过拟合。腾讯优图实验室提出Training - Free GRPO,无需更新参数,通过上下文学习提升性能,成本低且泛化性好,是传统强化学习有力替代。

深度学习自然语言处理
产品应用7

一手实测!不用研究小龙虾了:腾讯搬出QClaw,直连微信,零门槛

腾讯基于OpenClaw开源生态推出QClaw,主打简单、零门槛部署,可直连主流大语言模型,集成微信能远程操控电脑。还推出SkillHub技能社区,腾讯电脑管家有安全防护功能,但权限问题待解决。

机器之心
新闻资讯8

看完智平方创始人郭彦东的这场演讲,我对 VLA 又有信心了

2026年具身智能赛道技术路线引争论,“VLA时代终结”论调扩散。智平方创始人郭彦东演讲回应,称VLA时代未终结,世界模型汇入VLA,关键变量是类脑架构,智平方技术成果和开源平台也证明VLA有生命力。

AI科技评论
算法论文8

成本暴降88%!通义实验室、北大发布ZeroSearch,无需搜索即可激活LLM检索能力

信息检索能力对提升大语言模型推理表现至关重要,但现有方法在训练中面临文档质量不可控和搜索 API 成本高昂两大挑战。为此,通义实验室和北大提出 ZeroSearch 框架,无需真实搜索即可激活 LLM 检索能力,显著降低成本。

机器之心
新闻资讯7

承认自己开源不行?转型“美国DeepSeek”后,两个谷歌研究员的AI初创公司融到20亿美元,估值暴涨15倍!

AI创业公司Reflection AI由两位前Google DeepMind研究员创立,一年完成20亿美元融资,估值达80亿美元。它从编码智能体起步,现转型为开源替代公司,主打“开源”牌,计划明年推前沿语言模型

AI前线
算法论文8

TreeHop:无需LLM的高效多跳问答新范式

多跳问答(MHQA)任务有挑战,现有方法依赖LLM,计算成本高、延迟显著。TreeHop研究提出新方案,摒弃LLM,通过嵌入空间动态更新,降低延迟、减少模型参数量,还在主流数据集表现佳,适合工业应用。

深度学习自然语言处理
算法论文7

人多不管用!智能体团队别盲目扩张,最新综述给出三大维度

随着大语言模型驱动的多智能体系统快速发展,核心问题是有些系统规模扩大后会失稳、低效。美国、英国和澳大利亚研究人员提出三维分类框架描述大规模智能体网络,指出真正决定系统表现的是三种机制组合。

新智元