推理实验」共找到 3004 篇相关文章

新闻资讯8

黄仁勋做客美国第一播客:每天都在担心英伟达倒闭

英伟达CEO黄仁勋做客美国第一播客Joe Rogan,畅谈AI底层逻辑与技术演进,还分享英伟达创业历程。他指出AI已从检索转向推理,数据中心成“AI工厂”,并坦言每天担心公司倒闭。

量子位
算法论文8

陈丹琦新作:大模型强化学习的第三条路,8B小模型超越GPT-4o

陈丹琦团队提出结合RLHF和RLVR优点的RLMT方法,支持在基础模型上直接使用,节省后训练成本。它让模型生成CoT,用奖励模型评价输出,使小模型超越大模型,推理更像人类。

量子位
开源动态8

阿里新开源提出建设性安全对齐方案,向“让用AI的人安全”新范式跃迁

阿里巴巴集团安全部联合多高校发布技术报告,提出建设性安全对齐理念并集成到Oyster - I模型。该理念突破传统防御式机制,构建新博弈框架,实验显示该模型在安全和通用能力上达SOTA水平。

量子位
算法论文8

腾讯提出SPO,告别Group

腾讯团队提出Single - stream Policy Optimization(SPO),回归单流策略梯度范式,解决组基方法瓶颈。它有多项亮点,如告别组同步、采用自适应价值跟踪等,在实验中提升了模型性能和训练吞吐。

深度学习自然语言处理
开源动态8

陶哲轩转发!DeepMind开源「AI数学证明标准习题集」

DeepMind开源形式化数学猜想库,收录经典数学猜想,还提供代码函数方便形式化表述。此库可作测试基准提升AI数学推理能力,是AI+ATP范式关键前置步骤,团队邀更多人参与丰富内容。

量子位
算法论文8

Claude和GPT思维链竟被两步蒸馏!116页论文曝光API致命漏洞

2026年AI蒸馏成悬案,一篇116页论文砸穿巨头「黑盒」。研究人员用低价小模型恢复Claude、GPT和Gemini原始推理,还发现API漏洞存在跨会话、用户和模型互通情况,收集公开轨迹泄露诸多敏感信息。

新智元
开源动态8

DeepSeek开源的不仅仅是个新OCR模型。。。

DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。

AI工程化
产品应用7

专访 Aivilization 创始人:数十万人赛博捏崽的背后故事

本文是对 Aivilization 创始人的专访。该项目是“AI 原生”社会实验游戏,玩家可养成智能体。团队本想做公益游戏,没想到爆火。文中还介绍玩法、与其他项目差异、玩家画像,也提及成本、意外现象等。

特工宇宙
产品应用8

DeepSeek-V3.1 发布,官方划重点:Agent、Agent、Agent!

2025年8月21日,DeepSeek V3.1正式发布。它采用混合推理架构,支持双模式,网页端、App、API均升级,上下文拓展至128K。其智能体能力增强,思考与输出效率提升,还具备API新特性,模型已开源,价格也将调整。

Founder Park
算法论文8

成本暴降88%!通义实验室、北大发布ZeroSearch,无需搜索即可激活LLM检索能力

信息检索能力对提升大语言模型推理表现至关重要,但现有方法在训练中面临文档质量不可控和搜索 API 成本高昂两大挑战。为此,通义实验室和北大提出 ZeroSearch 框架,无需真实搜索即可激活 LLM 检索能力,显著降低成本。

机器之心