「新推理模型」共找到 9817 篇相关文章

新闻资讯8

中国AI「星际穿越」!新智元十周年峰会预言ASI终局:未来十年指数级加速

新智元十周年峰会以「新天终启 万象智生」为主题,众多大咖齐聚。王海峰、赖俊杰、王小川等分享观点,还开源模型、发布奖项。大家认为AI发展虽有波折,但2027年将达ASI临界点,智能体大爆发。

新智元
新闻资讯8

OpenAI连破10道数学难题,Fable 24小时「复现」5道

这个周末,OpenAI与Anthropic两大AI巨头在数学前沿短兵相接。先是OpenAI用未发布模型Astra证明10项数学成果,不到24小时,Anthropic的Fable复现了其中5项。AI解难题成本降低,成果验证成新考验。

新智元
产品应用8

Claude 4.x 的提示工程实战指南

Anthropic在官方文档上线Claude 4.x提示工程指南,针对4.5系列模型优化。介绍基本原则、长期推理和状态跟踪方法、沟通风格,还给出特定场景指导及迁移考虑,助你发挥Claude 4.x实力。

AI工程化
算法论文8

RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈

大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。

深度学习自然语言处理
7

逼AI当山顶洞人!Claude防话痨插件爆火,网友:受够了AI废话

一个叫「caveman」的Claude Code插件在Hacker News爆火,冲破2w星。它核心是条prompt,删掉冠词等废话,号称省75%输出token。但它不压缩模型后台推理token,真实成本节省存疑。

新智元
新闻资讯8

腾讯发布超低成本AI训练法!120元效果秒杀70000元微调方案

腾讯提出无训练组相对策略优化Training-Free GRPO,无需调整参数,在提示词中学习经验就能提升模型性能。实验显示,该方法在数学推理和网页搜索任务上效果显著,成本远低于传统方法。

量子位
开源动态8

谷歌最新「0.27B」Gemma 3开源!身板小却猛如虎,开发者直呼救命稻草

大模型时代开发者算力焦虑严重,谷歌Gemma 3系列另辟蹊径。新成员Gemma 3 270M参数规模小但性能强,如在IFEval测试表现突出,有小体积强架构、省电等亮点,适用于多场景。

新智元
新闻资讯7

全网破防,AI「手指难题」翻车逼疯人类!6根手指,暴露Transformer致命缺陷

最近网友被AI「手指难题」逼疯,给AI六指手,它始终无法数对。GPT - 5.2、Nano Banana Pro等均翻车。此问题揭露当前模型思考机械、割裂等缺陷,也凸显Transformer架构弱点。

新智元
新闻资讯7

数学家24小时驳回OpenAI攻破的猜想!“AI证对了每句话,但已跟原猜想无关”

OpenAI宣称其下一代AI模型推翻了Connes刚性猜想,第二天堪萨斯大学的J. L. Nielsen就发文回应,指出AI构造的群不满足附加条件,还逐行核对代码指出‘要证什么’有问题,强调人类审查对AI科研结果很关键。

量子位
开源动态9

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…

本文是量子位作者对阶跃星辰新发布的开源旗舰大模型Step 5 Preview的实测与解读,介绍了其参数架构、评测排名、成本优势,展示了多类任务实测效果,分析了技术路线与行业价值。

量子位