算法论文8
Google:模型强推理或非因计算时间
PaperAgent
AI 摘要
Google:OpenAI的o系列等模型推理能力提升,并非仅靠计算时间,而是隐式模拟复杂互动。推理能力跃迁或因‘吵得更凶’,推理模型似多agent系统,社会扩展律值得关注。
阅读原文 · PaperAgent
测试时Scaling或是最大错觉,Google:R1/O1强推理另有原因
Google 112 页论文实证,OpenAI 的 o 系列等模型推理能力提升并非仅因计算时间延长,而是源于对复杂互动的隐式模拟。通过三重验证表明推理能力跃迁或因‘吵得更凶’,而非‘算得更久’。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
阿里云平台完成 DeepSeek Harness 评测
本文分享基于阿里云 AgentLoop 平台的 DeepSeek Harness 评测实践。介绍了 DeepSeek Harness 工程架构,阐述 AgentLoop 平台接入方式及价值,还详述评估器设计思路、展示评测结果,最后总结方法论并展望后续工作。
阿里云开发者
开源动态7
HarnessEval开启RSI时代新评测范式
过去一年AI进入RSI时代,但评测方式仍停留在过去。MirroS联合多方发布HarnessEval,将Harness引入评测领域,使评测成为具备自我进化能力的智能系统,还率先应用于交互式世界模型评测。
特工宇宙
新闻资讯7
DeepSeek涨价,OpenAI降价,Agent改写价格战
近期,DeepSeek上调API价格,V4 Pro等型号涨幅明显;而OpenAI的GPT - 5.6 Luna API价格降80%,Terra降20%。这背后是大模型价格竞争方向转变,受竞争、广告、效率及Agent使用方式等因素影响。
DeepTech深科技
新闻资讯7
腾讯600万奖金赛,探索推荐系统大一统
腾讯营销以KDD Cup 2026官方赛道身份出题,聚焦推荐系统统一建模,奖金600万+。全球众多选手参与,学术和工业赛道各有冠军方案,还设创新奖。赛事也推动了鹅厂人才培养体系的拓展。
量子位