「新推理模型」共找到 9672 篇相关文章
数学题干带猫AI就不会了!错误率翻300%,DeepSeek、o1都不能幸免
研究发现,在数学题后加如“猫一生绝大多数时间都在睡觉”这类话术,会让大模型答错概率翻3倍,DeepSeek - R1、OpenAI o1等推理模型中招。研究探索攻击方式,总结出三种攻击模式。
61.3%!「人类最后一场考试」AI终于及格了,揭秘Agent自我进化新路径
上海交通大学等联合团队提出MemRL框架,在不微调模型参数下,让AI在“人类最后一场考试”中准确率跃至61.3%。该框架受人类认知科学启发,解耦推理与记忆,实验表现出色,或为AGI提供高效路径。
经验记忆黑科技:LightSearcher让AI工具调用减39.6%、推理快48.6%
现有的 RL 驱动的深度思考大模型系统面临准确率与效率的「跷跷板」困境,北邮百家 AI 团队提出 LightSearcher 框架,解决了这一痛点,在保持准确率的同时,显著提升了工具调用效率。
6666!NuerIPS满分论文来了
NuerIPS唯一满分论文结论惊人,指出真正决定推理上限的是基座模型本身而非强化学习,且蒸馏比强化学习更有望实现大模型自我进化,这给正火热的RLVR泼了冷水。
火山引擎,「出击」Agent
2025 年年中大模型竞争进入下半场,Agent 成焦点。文章分析其 2B 与 2C 落地困境,介绍火山引擎新开发范式,如 TRAE、豆包大模型 1.6、PromptPilot 等,助企业解决 B 端落地难题。
GPT-5、Grok 4、o3 Pro都零分,史上最难AI评测基准换它了
AAI机构提出新基准FormulaOne,让GPT - 5、o3 Pro等前沿大模型集体得零分。该基准含220个图结构动态规划问题,分三类难度。测试结果显示,模型在深层及最深层难度表现差,引发关注。
从少样本到千样本!MachineLearningLM给大模型上下文学习装上「机器学习引擎」
新研究 MachineLearningLM 提出轻量可移植「继续预训练」框架,突破 LLM 在上下文学习局限,能学上千示例,在多领域分类任务超基准模型。它有三项核心创新,效果惊艳且应用潜力大,还指明未来研究方向。
时隔9个月Meta全新模型Muse Spark发布:闭源,原生多模态,一发布就落后?
时隔9个月,Meta推出Muse家族首款大模型Muse Spark,原生多模态推理,但能力表现一般,编程领域落后于opus 4.6和GPT 5.4等。它有沉思模式,致力于成个人超级智能,技术亮点多,性能高效。
GPT-5.4 发布,OpenClaw的能力要被取代?OpenAI 新模型不仅会自己用电脑,编程能力也拉满了
今天 GPT-5.4 发布,整合推理、编程及原生计算机使用能力。其原生电脑操作能力提升,与 OpenClaw 竞争。还带来工具搜索降成本、减少幻觉,编程能力增强但价格也升级。
首个测试时共进化合成框架TTCS:在「左右互搏」中突破推理瓶颈
厦门大学DeepLIT课题组提出全新测试时课程合成框架TTCS,不依赖外部标注,通过生成器与求解器共进化博弈合成课程数据,解决测试样本过难导致的训练坍塌问题,实验显示其推理能力提升显著。