长上下文推理」共找到 2082 篇相关文章

算法论文8

【梁文锋署名】DeepSeek再发新论文:75%思考+25%记忆,这是他们算出来的最优解

DeepSeek新论文《Conditional Memory via Scalable Lookup》提出Engram模块,指出大模型用计算模拟查字典是浪费算力,Engram能给模型装“记忆”,还发现参数分配呈U型缩放定律,推理长上下文能力提升显著。

花叔
新闻资讯7

Mistral 为 Le Chat 新增远程智能体与 Work 模式

Mistral发布1280亿参数的Mistral Medium 3.5模型,在Vibe和Le Chat引入云端智能体能力,还在Le Chat新增Work模式。新模型可自托管,支持长上下文窗口。社区反馈积极,开发者认可,也有人嫌定价贵。

InfoQ
开源动态8

重磅!DeepSeek再开源:视觉即压缩,100个token干翻7000个

DeepSeek-OCR模型探索视觉-文本压缩边界,用少量视觉token解码出10倍以上文本信息。它在OmniDocBench基准上表现超GOT-OCR2.0,为LLM长上下文问题提供方案,还能处理多类图像与近100种语言。

新智元
算法论文7

港中文 MMlab×美团新研究:仅用一个模型,应对多种视觉推理任务

港中文 MMLab 与美团联合提出 OneThinker 多模态统一推理模型,将多种视觉任务抽象为‘先推理、后作答’形式,通过多任务强化学习优化。实验显示其在多任务表现佳,为通用视觉推理模型提供参考。

AI科技评论
产品应用7

Qwen3接连放出No Thinking, Thinking两大模型,Gemini2.5 pro顶不住啦

Qwen推出非推理模型`Qwen3 - 235B - A22B - Instruct - 2507`后,又放出推理模型`Qwen3 - 235B - A22B - Thinking - 2507`。非推理模型在多方面功能增强,推理模型能力强,超DeepseekR1,可试用。

CourseAI
算法论文8

清华校友出手,8B硬刚GPT-4o!单一模型无限工具调用,终结多智能体

MIT等机构推出TIM和TIMRUN组合拳,突破模型token天花板。TIM将推理建模为任务树,TIMRUN优化内存管理。二者结合支持长程推理,实现单模型高效推理,简化智能体构建,在多方面表现出色。

新智元
8

AI真的需要「像人类」那样思考吗?AlphaOne揭示属于大模型的「思考之道」

近年大模型在推理任务有进展,但缺乏推理节奏调控能力。伊利诺伊大学厄巴纳 - 香槟分校和加州大学伯克利分校研究提出 AlphaOne 框架,引入 α - moment 实现无需训练的推理调控,实验显示其能提升准确率和效率。

机器之心
算法论文8

ICML 2025 | 大模型能在信息不完备的情况下问出正确的问题吗?

当前大语言模型推理研究多聚焦被动推理,主动推理研究少,制约其在现实场景应用。为此提出 AR - Bench 基准评估大模型主动推理能力,实验显示大模型主动推理能力严重不足,并指出后续拓展方向。

机器之心
算法论文8

为大模型思考装上“猎鹰重装引擎” :腾讯混元 SEAT 重塑深度思考

本文深度解析腾讯混元最新发布的 SEAT 自适应并行扩展推理框架。它让大模型 CoT 升级,应对复杂推理任务。该框架通过多轮并行推理和语义熵导航,解决大模型深度思考的局限,且适配多种大模型,性价比高。

AI科技大本营
算法论文8

MIT & Google | 提出异步并行生成新范式,LLM推理效率大幅提升!

MIT与谷歌团队在研究PASTA中探索异步生成范式,开发标记语言PASTA - LANG,采用双阶段训练流程,设计推理系统。实验显示PASTA平衡性能与质量,有可扩展性,为LLM推理效率优化开创学习驱动新路径。

AINLPer