「复杂推理能力」共找到 5065 篇相关文章
grok 4一图流
文章展示grok 4核心数据,涵盖训练成本、模型定价,还列举其在通用、专业、数学、推理、编程等能力测试中排名第一的成绩,不过实际水平还有待观察。
Qwen3接连放出No Thinking, Thinking两大模型,Gemini2.5 pro顶不住啦
Qwen推出非推理模型`Qwen3 - 235B - A22B - Instruct - 2507`后,又放出推理模型`Qwen3 - 235B - A22B - Thinking - 2507`。非推理模型在多方面功能增强,推理模型能力强,超DeepseekR1,可试用。
Gemini 3 编程第一断崖式领先,谷歌 AI Mode 直接装备 G3,反重力的 Antigravity 是啥?
今年 8 月发布的 GPT 5 未达成 AGI,Gemini 3 能力提升明显。谷歌将其塞进 Search 的 AI Mode,AI 普惠意义超能力升级。开发者方面,它是主力型号,编程能力跃升,还加强 Agent 能力并推出新工具 Antigravity。
清华校友出手,8B硬刚GPT-4o!单一模型无限工具调用,终结多智能体
MIT等机构推出TIM和TIMRUN组合拳,突破模型token天花板。TIM将推理建模为任务树,TIMRUN优化内存管理。二者结合支持长程推理,实现单模型高效推理,简化智能体构建,在多方面表现出色。
公开模型一切,优于DeepSeek-R1,英伟达开源Llama-Nemotron家族
英伟达推出面向高效推理的 Llama-Nemotron 系列模型,包括 Nano、Super、Ultra 等规模,具备卓越推理能力与效率,采用开放许可。模型支持动态推理切换,训练结合多方法,性能优于 DeepSeek-R1 等。
模型越聪明越“不听话”?MathIF基准揭示AI服从性漏洞
上海人工智能实验室与香港中文大学研究团队发布论文,用MathIF基准揭示大模型“聪明”和“听话”有矛盾,越擅长推理越易忽略指令,还分析了原因并给出让模型更“听话”的方法。
ICML 2025|如何凭「自动补全」实现100K生成3×加速?
在大模型推理复杂的当下,生成超长文本成本高。BIGAI NLCo团队提出推理加速框架TokenSwift,被ICML 2025接收。它重构传统自回归推理,解决长生成瓶颈,在多模型实验中表现亮眼。
GPT-5 不是技术新范式,是 OpenAI 加速产品化的战略拐点
文章从不同视角评价 GPT - 5,指出它是 ChatGPT 产品重要升级,是 Router 驱动系统。介绍其能力提升与短板,如 Vibe coding 性价比高但 Agentic 能力不足,还探讨了商业影响、价格战等,期待其 Agentic 能力发展。
大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱
CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。
挖到 9 个 Claude Skills 宝藏开源项目,AI 能力直接拉满!
Claude Skills 热度高,作者梳理分享 9 个值得关注的开源项目。涵盖官方与生态合集、任务规划与技能探索、Agent 与工程化实践等类别,展示不同场景应用,助读者找适合项目。