「推理评估」共找到 2634 篇相关文章
45年数论猜想被GPT-5.2 Pro独立完成证明,陶哲轩:没犯任何错误
2025年1月17日,研究者Neel Somani让GPT-5.2 Pro解1980年提出的埃尔德什猜想第281号问题,证明经陶哲轩验证成立。此外,网友发现有更简单经典解法。陶哲轩提醒评估AI真实成功率有报告偏差。
100万亿Token揭示今年AI趋势!硅谷的这份报告火了
OpenRouter和a16z联合发布《State of AI:An Empirical 100 Trillion Token Study with OpenRouter》,基于100万亿Token分析模型真实使用情况,揭示2025年AI发展趋势,如开源模型崛起、推理模型成新范式等。
LeCun团队开源首个代码世界模型:能生成代码还能自测自修!传统编程模型一夜成古典
Meta FAIR推出全球首个代码世界模型CWM,它能生成代码、理解语义,还‘懂得’代码执行,能模拟运行过程。在多个代码与推理任务表现出色,开源代码、训练细节等,不过目前仅支持Python。
小扎狂砸3亿美金薪酬包!奥特曼放狠话:传教士终将打败雇佣兵
新智元报道,Meta挖走近十位OpenAI研究员,小扎砸3亿美金薪酬包。奥特曼内部喊话“传教士将打败雇佣兵”,抨击Meta挖人,还暗示评估薪酬方案。当前硅谷AI抢人大战白热化,人才薪酬暴涨。
把 RAG 做成主流的公司,现在开始“做空”RAG 了
Pinecone 曾将 RAG 定义成大语言模型 grounding 标准范式,如今却宣布 RAG 时代结束。它推出面向 Agent 的知识引擎 Nexus,提出“知识编译”概念,称能提高任务完成率、降低 token 开销,整个 AI 世界都在将“推理”往上游移动。
AI自动写学术综述:10分钟生成6万字,成本不到四块钱
上海人工智能实验室等单位提出SurveyForge框架,能自动化生成高质量学术综述论文。它有双数据库协同驱动的大纲生成机制、学者导航代理SANA和并行生成与协调机制。还有SurveyBench评估框架,实验显示其效果好,应用前景广。
怎么回事?刚被OpenAI收购,Windsurf就发了个自己的模型
5月初,刚被OpenAI收购的Windsurf发布AI编程模型SWE - 1,该模型针对软件工程全流程,核心是流动感知,实现人机自然交接。它有三个系列,已上线可免费使用,开发灵感源于编辑器,在评估和实测中表现良好。
谷歌Jeff Dean和多位图灵奖得主合著论文,全面剖析了AI
谷歌Jeff Dean和图灵奖得主John Hennessy等联合发布报告《塑造AI对数十亿人的影响》,拒绝AI极端观点,选择务实。报告剖析打破“饭碗焦虑”、重塑教育医疗等内容,Laude研究所也开展实战评估项目。
社区供稿丨如何抑制大模型的“过度反思”:Yuan3.0 Flash 中的强化学习范式
大模型在企业落地时存在“过度反思”问题,浪费算力。YuanLab.ai团队在Yuan3.0 Flash模型中提出RIRM与RAPO,前者奖励“思考过程”,后者优化训练框架,实现推理效率提升,适用于企业场景。
端到端智驾新SOTA | KnowVal:懂法律道德、有价值观的智能驾驶系统
北京大学王勇涛团队提出新型自动驾驶系统 KnowVal,通过感知与知识检索模块协同实现视觉 - 语言推理。它构建驾驶知识图谱,有价值模型用于轨迹规划,实验在多基准测试表现佳,还通过定性分析验证效果。