「非推理型模型」共找到 8399 篇相关文章
美团智能体SOTA模型LongCat-Flash-Thinking-2601开源
美团龙猫团队开源智能体推理模型LongCat - Flash - Thinking - 2601,总参数5600亿。该模型在多方面有卓越表现,团队通过构建数据、模拟环境、采用强化学习策略及设计高效架构等,使其比肩闭源模型。
OpenAI谈:大模型为什么会有幻觉?如何避免?
OpenAI论文探讨大模型幻觉问题,指出评测缺陷,像多数AI模型评测非对即错,模型为得分会瞎猜。还从预训练和后训练阶段剖析根源,提议改造评测,引入置信度阈值和错误惩罚机制。
中兴星云拿下推理总分榜一!SuperCLUE 5月成绩出炉
2025年全球AI大模型竞赛激烈,SuperCLUE发布5月报告,中兴通讯星云大模型Nebula Coder - V6推理专项榜单总分并列第一、总榜并列第二,细分赛道表现佳,且是少数获国家级权威安全认证的大模型。
ICML 2026 | 只用少量Thinking Tokens,大模型依然能深度思考
近年来,CoT 推理成为提升大模型复杂问题求解能力的重要路径,但带来效率问题。浙江大学等团队提出 Heima 框架,将冗长 CoT 压缩为少量 thinking tokens,在减少 token 数的同时保留推理能力,已被 ICML 2026 接收。
公开模型一切,优于DeepSeek-R1,英伟达开源Llama-Nemotron家族
英伟达推出面向高效推理的 Llama-Nemotron 系列模型,包括 Nano、Super、Ultra 等规模,具备卓越推理能力与效率,采用开放许可。模型支持动态推理切换,训练结合多方法,性能优于 DeepSeek-R1 等。
「百万级」视频推理数据集!30+顶尖高校联合发布
AI视频生成已能「画得像」,但不会「想得对」。VBVR推出百万级视频推理数据集,首次系统评测模型对空间、物理、逻辑和抽象的推理能力,发现顶尖模型通过率仅68%,推动视频AI从「视觉模仿」迈向「智能推理」。
国产大模型新SOTA:蚂蚁万亿级旗舰模型赶超GPT-5
蚂蚁集团开源万亿参数旗舰大模型Ling-1T,属Ling 2.0家族。它激活比例低降低运算成本,训练有“Ling缩放定律”等方法,多项测试超主流模型,不过处理超长上下文成本较高。
OpenAI自曝:AI推理砸钱越多,碾压人类越狠!
OpenAI研究员探讨推理模型时代。Noam Brown强调预训练和推理范式,指出当前AI胜在通用性。推理范式成本低、效果好,如o系列模型表现出色。首席经济学家谈AI经济影响,称其重塑企业格局。
CoT推理大溃败?哈佛华人揭秘:LLM一思考,立刻就「失智」
新研究揭示思维链CoT会分散模型「注意力」,使大模型推理时易出错。研究指出在需遵守指令任务中,用CoT推理模型准确率下降,还总结了四大模式,并提出四种缓解策略。
EMNLP 2025 浙大&蚂蚁 | 提出动态压缩CoT推理新方法:LightThinker
随着AI发展,大语言模型处理复杂推理任务能力提升,但推理时产生大量中间步骤和文本,拖慢计算速度、增加资源压力。浙大、蚂蚁等机构研究者提出LightThinker,可动态压缩推理步骤,降低内存占用和计算成本。