类LLM机制」共找到 1976 篇相关文章

开源动态8

无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab

多图像、长视频让大型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。

量子位
新闻资讯8

那个固执的法国老头走了,带走了硅谷最后的理想主义

2026年1月,65岁的Yann LeCun离职Meta创业后炮轰老东家。他曾被扎克伯格“三顾茅庐”加入Facebook,创建FAIR。他推动了PyTorch发展,坚持智能应基于世界模型,与主流LLM路线分歧,最终因理念不合离开。

AI科技大本营
算法论文8

国际头部高校联名发布 Agentic AI 的真正进化论

目前从‘LLM’向‘Agentic AI’跃迁,Agent实操能力不足。论文《Adaptation of Agentic AI》梳理领域情况,提出2x2象限框架,介绍优化Agent及工具的方法,还提及局限和未来方向并给出战术建议。

深度学习自然语言处理
算法论文8

如何改变AI研究范式?谷歌DeepResearch新方法TTD-DR原理与实现 | 原理篇

谷歌提出新的DeepResearch方法TTD - DR,它模拟人研究范式,将Agent起草的初稿视为‘含噪声输出’,经多轮检索 - 改进使初稿成高质量终稿,还引入自进化机制,测试显示其在复杂任务上领先。

AI大模型应用实践
算法论文8

Meta打开AI元认知,让AI不止会解题,还会总结套路了

Meta等机构提出‘元认知重用’机制,让大模型学会反思总结。大模型打造‘行为手册’,与主流RAG系统有本质区别。研究人员设计三种实战用法,虽有局限,但为大模型推理难题提供了解决方案。

AIGC开放社区
算法论文8

大模型到底是怎么「思考」的?第一篇系统性综述SAE的文章来了

在大语言模型时代,人们需要“能解释”的LLM。SAE技术崛起,作者团队发布首篇SAE综述,梳理其技术、演化和挑战。介绍了SAE概念、优势,涵盖其技术框架、可解释性分析等多方面内容。

机器之心
算法论文8

ICLR 2026 Oral | 西湖大学发布Real PDE Bench

复杂物理系统时空演化预测是核心问题,当前AI模型多在数值仿真数据上训练,难以评估其在真实数据上的表现。西湖大学等实验室提出RealPDEBench,含真实与仿真数据,设三任务、九个评估指标和十个基线方法。

力学与人工智能
算法论文7

R1/Qwen训练新范式:无需继续训练,直接“算”出权重,提效500%

DeepSeek - R1爆火让RLVR成大模型后训练焦点,但训练代价高昂。学者发现RLVR中LLM权重和输出概率呈线性变化,提出“权重外推”等方法,实现最高6.1倍训练加速,RL - Extra在多榜单展现高效率。

PaperAgent
开源动态8

告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆

中国人民大学团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给轻量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试中超越现有SOTA方案。

深度学习自然语言处理
算法论文8

TruthfulRAG,用知识图谱硬刚RAG知识冲突

RAG系统存在知识冲突问题,现有解决方法治标不治本。TruthfulRAG将非结构化文本转化为结构化事实,通过图构建、图检索、冲突解决三大模块解决冲突,实验显示其表现优异,结构化表示还提升了LLM置信度。

PaperAgent