自演进评测」共找到 1873 篇相关文章

新闻资讯8

刚刚,OpenAI官宣研造芯,联手博通开发10吉瓦规模的AI加速器

今天凌晨,OpenAI宣布与博通战略合作,共同部署其设计的10吉瓦规模AI加速器,预计2026下半年起部署机架,2029年底完成。此次合作将减少其对英伟达GPU依赖,采用多元化算力策略。

机器之心
算法论文8

CMU&斯坦福提出Reasoning新范式!己找“窍门”,教会LLM抽象Reasoning

大型语言模型解决复杂推理问题时效率低,论文提出创新方法,让模型利用“推理抽象”,通过RLAD两玩家强化学习框架训练,在多基准测试提升性能,还分析了其作用、局限与未来方向。

深度学习自然语言处理
开源动态8

vivo研蓝河操作系统内核开源!Rust开发新机遇来了

vivo宣布开源研蓝河操作系统内核,它由Rust语言编写,解决了传统C语言难题,更轻量化、对硬件要求低且支持多架构。此次开源不仅是国产操作系统突破创新,还将推动Rust生态发展。

量子位
产品应用7

BrowseComp等评测集第一,秘塔推出「深度研究」,已开启免费公开访问

世界变化快,AI领域新概念不断。秘塔在上线“浅度研究”五个月后,将其升级为“深度研究”。该模块最初由OpenAI推出,秘塔版可免费公开访问,准确率优,还让研究过程可见。

深度学习自然语言处理
算法论文8

北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”

北京大学DS - Lab发布ScholarSearch,这是评估大语言模型学术检索能力的数据集,含223道高难度题目。评估显示现有模型表现欠佳,纯推理模型准确率低,有搜索功能的模型虽有提升但仍不足。

量子位
算法论文8

AI数学能力暴涨100%,进化直逼RL极限!CMU新作颠覆认知

数据枯竭成AI发展瓶颈,CMU团队提出SRT方法,让LLM我进化,提升数学与推理能力,性能逼近传统强化学习。研究还分析其局限,提出缓解奖励作弊策略及应对模型崩溃的方法。

新智元
产品应用7

怎么回事?刚被OpenAI收购,Windsurf就发了个己的模型

5月初,刚被OpenAI收购的Windsurf发布AI编程模型SWE - 1,该模型针对软件工程全流程,核心是流动感知,实现人机然交接。它有三个系列,已上线可免费使用,开发灵感源于编辑器,在评估和实测中表现良好。

Founder Park
新闻资讯8

银河通用王鹤:具身智能正迎来己的 「AlphaGo」 和 「ChatGPT」时刻

银河通用创始人王鹤在2026年北京智源大会指出,具身智能正迎来“AlphaGo”和“ChatGPT”时刻。银河通用取得多项首创突破,其基座大模型“银河星脑”展示完整技术脉络,引领具身智能迈向通用未来。

AI科技评论
新闻资讯8

己会失业!田渊栋八人天团狂揽44亿元,杀入「递归进化」赛道

Recursive Superintelligence由八位顶尖AI研究员创立,获GV、英伟达等投资6.5亿美元。他们要让AI我训练,实现递归我进化,若成功或使AI研究员岗位消失。此前已有相关成果,产品端Anthropic也在推进AI主动性。

新智元
算法论文8

上交大54页综述讲透Agent认知外部化的演进之路

上海交大联合多机构提交综述论文,首次以「外部化」为统一视角,梳理了LLM Agent的记忆、技能、协议与Harness工程四大支柱。指出Agent实际进展取决于外部认知基础设施,而非模型能力提升。

机器之心