「推理架构」共找到 3525 篇相关文章
港中文 MMlab×美团新研究:仅用一个模型,应对多种视觉推理任务
港中文 MMLab 与美团联合提出 OneThinker 多模态统一推理模型,将多种视觉任务抽象为‘先推理、后作答’形式,通过多任务强化学习优化。实验显示其在多任务表现佳,为通用视觉推理模型提供参考。
Qwen3接连放出No Thinking, Thinking两大模型,Gemini2.5 pro顶不住啦
Qwen推出非推理模型`Qwen3 - 235B - A22B - Instruct - 2507`后,又放出推理模型`Qwen3 - 235B - A22B - Thinking - 2507`。非推理模型在多方面功能增强,推理模型能力强,超DeepseekR1,可试用。
清华校友出手,8B硬刚GPT-4o!单一模型无限工具调用,终结多智能体
MIT等机构推出TIM和TIMRUN组合拳,突破模型token天花板。TIM将推理建模为任务树,TIMRUN优化内存管理。二者结合支持长程推理,实现单模型高效推理,简化智能体构建,在多方面表现出色。
世界模型炒作了半年,反应速度还不如 VLA?穆尧团队和百度智能云给出最新解法
生成式世界模型用于机器人控制备受争议,因其推理延迟高。上海交通大学 ScaleLab 团队等联合发布 AHA - WAM,解决推理延迟和时空分辨率错配问题,在任务成功率和推理速度上领先,还需系统协同推进落地。
Remix 3终结以React为中心的架构
多年来,React 一直是全栈 JavaScript 架构基础。但 Remix 3 挑战了这一局面,它遵循渐进式增强和服务器优先原则,将 Web 基本原理置于核心,重新定义构建方式,引发对 React 中心架构的思考。
清华唐杰团队揭示大模型记忆全景
清华唐杰教授团队等发布大模型记忆架构综述,提出三维记忆分类学,将前沿工作统一到理论框架,为LLM设计指明方向,分析了隐式、显式记忆架构,还探讨混合架构挑战与未来方向。
Anthropic发布多Agent协作模式指南:5种架构与适用场景
当单个AI Agent无法完成任务时,多Agent系统就派上了用场。Anthropic最新发布的指南给出了五种经过验证的模式,包括生成 - 验证模式、编排 - 子代理模式等,并介绍了适用场景和陷阱。
AI真的需要「像人类」那样思考吗?AlphaOne揭示属于大模型的「思考之道」
近年大模型在推理任务有进展,但缺乏推理节奏调控能力。伊利诺伊大学厄巴纳 - 香槟分校和加州大学伯克利分校研究提出 AlphaOne 框架,引入 α - moment 实现无需训练的推理调控,实验显示其能提升准确率和效率。
Anthropic 的 Harness 哲学:把 Agent 当牲口,而非宠物
本文分享Anthropic最新两篇博客,介绍其将运维圈“宠物 vs 牲口”哲学用于AI Agent架构设计。旧架构如“宠物”易出问题,新架构脑手分离,把Harness做成可随时重启的“牲口”,降低延迟、提升安全,还提出信任框架。
刚刚,DeepSeek 突发梁文峰署名新论文:V4 新架构提前曝光?
今天凌晨,DeepSeek在其GitHub官方仓库开源了新论文与模块Engram。该论文提出“查—算分离”机制,通过引入可扩展的查找记忆结构,在等参数、等算力条件下提升模型表现,代码与论文全文均已开源。