「复杂推理任务」共找到 4030 篇相关文章
基于闪电注意力机制,创新高效开源大模型
传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。
Anthropic 新研究:AI出错是“热混乱”
Anthropic研究团队发现AI可能无一致目标,只是瞎搞。他们将AI错误分类,测试发现推理越久越混乱,大模型复杂任务易失控。此发现改变对AI风险的认知,论文已在arXiv发布。
阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源
阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。
GPT-5真的拉胯吗?机器之心一手实测,网友:还我4o、还我4.5
OpenAI发布GPT - 5后评价褒贬不一。有人认为它进步大,也有人差评,如制作游戏、重构代码失败。机器之心实测发现其表现不稳定,写作、推理、编码能力有好有坏,复杂任务表现欠佳。
DeepMind揭示Reasoning内在机制
近年来大型推理模型在复杂任务表现出色,但推理机制成谜。本文提出用推理图解码其‘思考轨迹’,分析环状结构、直径大小和小世界特性,发现蒸馏模型等特点,为理解AI推理及模型优化指明方向。
牛!小米开源「音频语言模型」,超1亿小时预训练时间,音频理解和输出能力是真顶!
小米推出开源音频语言模型MiMo - Audio,有超1亿小时预训练时间。它能理解音频,70亿参数模型在多基准测试达SOTA,音频理解超Gemini - 2.5 - Flash,复杂推理优于GPT - 4o - Audio,还支持多模态任务。
推理路径的动态调控:让大模型学会“恰到好处”的思考
当前大模型推理路径存在冗余问题,本文提出测试时提示干预框架PI(π),通过《When/How/Which》三模块协同,将人类专家经验融入推理过程,在多个STEM基准测试中缩减推理步骤、提升准确率。
ICLR 2026|UIUC:一行代码彻底解决LLM推理的过度思考!
2025年DeepSeek发布推理大模型,引发RLVR研究热潮,但该方法有“过度思考”问题。伊利诺伊大学香槟分校等研究者提出Self - Aligned Reward(SAR),能提升推理准确度和效率,有望推动大模型推理系统发展。
大模型如何推理?斯坦福CS25重要一课,DeepMind首席科学家主讲
Google DeepMind首席科学家Denny Zhou在斯坦福CS25课程分享大语言模型推理见解,总结了四个关键点,阐述推理机制、优化方法及最新进展,还介绍多种推理方法并比较其优劣。
CMU&斯坦福提出Reasoning新范式!自己找“窍门”,教会LLM抽象Reasoning
大型语言模型解决复杂推理问题时效率低,论文提出创新方法,让模型利用“推理抽象”,通过RLAD两玩家强化学习框架训练,在多基准测试提升性能,还分析了其作用、局限与未来方向。