「数学推理测试」共找到 3512 篇相关文章
AI七个月突破数学家“围剿”反超人类!14位数学家深挖原始推理token:不靠死记硬背靠直觉
大模型o3 - mini - high在7个月内,于FrontierMath基准测试中,答题得分从2%提升到22%,超人类团队平均水平。数学家分析其推理记录,发现它靠直觉而非死记硬背解题,但也存在缺乏创造力等局限。
腾讯开源混元世界模型1.1,视频秒变3D世界,单卡推理仅需1秒
腾讯发布并开源混元世界模型1.1,是统一的端到端3D重建基座大模型。它支持从多视图或视频一键生成3D世界,单卡秒级推理完成高精度重建,性能达SOTA,还具多特性,打破技术壁垒。
QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5
通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三大“法宝”重塑模型能力,效果显著,相关代码已开源。
ACL 2026|打破推理同质化!阿里达摩院新作让RLVR从重复采样走向有效探索
阿里达摩院智能决策团队提出面向RLVR后训练的探索增强框架I²B-LPO,改进rollout策略,在关键节点生成更具区分度的推理轨迹,结合信息瓶颈自奖励机制,在多个数学基准上提升准确率与语义多样性。
68页论文再锤大模型竞技场!Llama4发布前私下测试27个版本,只取最佳成绩
《排行榜幻觉》论文指出Chatbot Arena存在问题,如少数大厂私下多版本测试选最优、数据访问不平等、用Arena数据训练可提性能、模型被大量静默弃用等,研究团队给出改进建议,官方也进行了回应。
斯坦福英伟达推出测试时强化学习:微调开源模型胜过顶级闭源模型,仅需几百美元
斯坦福、英伟达等提出TTT - Discover方法,基于开源模型gpt - oss - 120b,在测试阶段引入强化学习更新模型权重。它采用熵目标函数和PUCT启发机制,解决分布外问题,成本低且表现优,但目前适用于连续奖励场景。
不吹不黑,GPT-5代码能力究竟怎么样?跟 Gemini 和 Claude 的对比测试给你答案
作者测试了 GPT-5 的代码能力,并与 Gemini 和 Claude 对比。在不同代码任务中,各模型表现不同。如在生成网页任务里,GPT-5 部分结果不错,但受 32K 上下文限制,长文本处理不如 Gemini,硬实力也不如 Claude。
中科院联合清华等发布视觉语言行动推理模型VLA-R1,让机器人先思考再行动
中科院自动化所、清华和GigaAI联合发布视觉 - 语言 - 行动模型VLA - R1,让机器人先思考再行动。它通过构建数据集教模型思维链,结合监督微调与强化学习提升性能,经多场景测试表现出色。
GPT-6 真要来了!OpenAI全新推理架构“循环深度”首次曝光:可榨出14倍参数潜能
OpenAI将推旗舰模型GPT - 6(内部代号Astra),采用“循环深度”新技术,能榨出14倍参数潜能,降低成本,但会使AI推理过程不可读,加重安全担忧。OpenAI已因该模型“能力过强”踩刹车。
ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字与图像在统一架构中共同演化
NUS、ZJU 等联合提出「ThinkMorph」,主张文字与图像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。