「思维链推理」共找到 2412 篇相关文章
给大模型装上「思维分段引擎」:浙大InftyThink解锁无限深度推理
如今大模型长上下文推理面临计算成本高、推理易中断问题。浙大联合北大团队提出InftyThink新范式,将传统推理拆成短片段并总结,突破推理长度限制,在多基座模型实验中表现优异。
Kimi K3设计榜登顶焚诀公开:就藏在思维链里
Kimi K3在Design Arena单次生成前端榜单中夺冠。它做前端设计审美一流,靠独特思维链反复迭代优化方案,还具备强大数据索引能力。不过上线48小时因算力不足叫停新订阅。
多模态后训练反常识:长思维链SFT和RL的协同困境
华为与香港科大研究发现,多模态视觉语言模型中,长思维链SFT与RL组合难协同增益。研究引入难度分类方法构建数据集,分析各方法表现及组合策略困境,还给出实验发现与未来研究方向。
思维链之父跳槽Meta,不只因为1亿美元!离开OpenAI前泄天机
硅谷人才争夺战升级,Meta砸钱抢人,思维链之父Jason Wei从OpenAI跳槽到Meta。他离职前发博客,谈及从强化学习获得的人生启示,还阐述AI领域验证非对称性概念及重要性。
AI仅凭“自信”学会推理,浙大校友复刻DeepSeek长思维链涌现,强化学习无需外部奖励信号
UC Berkeley团队提出新训练方法Intuitor,大模型无需接触真实答案,仅优化自身信心就能学会复杂推理。该方法无需外部奖励信号或标注数据,用模型自身置信程度作内在奖励信号,在多任务表现良好。
视觉思维链全新架构,加州大学让多模态大模型有了灵性,整体性能提升5.3%
加州大学伯克利分校等团队提出视觉思维链(CoVT)架构,让视觉语言模型推理时生成连续视觉信号。它内化轻量级专家能力,采用对齐策略和四阶段训练,实验显示性能提升,还具可解释性。
更长的推理链反而导致更多幻觉,MLLMs 幻觉解法仅「抄作业」还不够?摘要
近日,斯坦福等校学者发现,更长推理链会让 MLLMs 产生更强幻觉。MLLMs 幻觉不仅涉及语言偏差,还有跨模态语义失配。主流多模态架构在结构设计和训练机制上的潜在失衡,是幻觉频发的主因。
Jason Wei也被小扎带走:思维链开创者、o1系列奠基人!这次真挖到OpenAI大动脉了
思维链提出者、o1系列模型关键人物Jason Wei被曝将入职Meta,o1另一位关键人物Hyung Won Chung也可能被挖走。小扎为顶尖AI人才提供强大支持,而OpenAI内部也存在增长混乱等问题。
腾讯混元TurboS技术报告首次全公开:560B参数混合Mamba架构,自适应长短链融合
腾讯公开混元TurboS技术报告,该模型是超大型Hybrid Transformer - Mamba架构MoE模型,融合Mamba与Transformer架构优势,有自适应长短思维链机制,激活参数56B。在多评测中表现佳,推理成本低。
DeepSeek推理最高提速6倍!开源研究:加装「思维进度条」,计算量减少30%
特拉维夫大学团队开发新方法,给LLM推理任务装进度条,控制推理深度和速度。提出“思维进度向量”TPV预测推理位置,干预TPV可“超频”“降频”,模型已在GitHub开源。