「人类最后一场考试」共找到 1514 篇相关文章
姚顺宇谷歌首秀,Gemini新模型刷爆SOTA:人类仅剩7人捍卫碳基编程
面对Claude Opus 4.6和GPT Codex 5.3的攻势,谷歌升级Gemini 3 Deep Think,在多项基准测试刷爆SOTA,推理成本降低82%。它还走进科研工程领域,其研发团队有不少华人,如姚顺宇、Yi Tay。
ICLR 2026 | Rebuttal 是一场「带着镣铐的舞蹈」?港科 RebuttalAgent 用心智理论「读懂」审稿人
香港科技大学研究团队提出 RebuttalAgent 框架,将心智理论引入学术 Rebuttal 任务。它通过 TSR 框架拆解任务,先‘读心’再‘落笔’,能生成有说服力回复,还可作为‘思维外挂’提升小模型表现。
Sam Altman与开发者的一小时对话:我们在“梦游般”走向风险,人类经不住Agent诱惑
Sam Altman在与开发者生态交流会上,针对GPT-5写作能力下降问题坦率回应,还发出一系列重磅信号,如警告生物安全风险、披露招聘计划等,并就软件工程、AI Agent等多个话题分享看法。
首个3D动作游戏专用VLA模型,打黑神话&只狼超越人类玩家 | ICCV 2025
淘天集团未来生活实验室团队提出首个3D动作游戏专用VLA模型CombatVLA,已被ICCV 2025接收。它能处理视觉输入输出动作指令,在战斗理解准确率和执行速度上表现优异,还构建了评测基准等。
全球独家首测Genie 3,实验室细节曝光超震撼!AGI最后一块拼图已实现
谷歌DeepMind的Genie 3发布,Youtuber全球独家首测,揭秘实验室细节。前谷歌研究员称其将颠覆游戏行业,它有诸多亮点,但也存在物理、社交交互等未解决问题,代表娱乐未来。
英伟达曾命悬一线!特朗普亲口承认想拆分英伟达,最后却被黄仁勋「说服」
特朗普在活动中回忆,得知英伟达近乎垄断时想拆分它,但顾问称拆分难,且追上英伟达至少需十年。黄仁勋成功说服其政府允许向中国售芯片,特朗普放弃拆分,此前拜登政府曾调查英伟达。
机器人的「GPT时刻」来了?丰田研究院悄悄做了一场最严谨的VLA验证实验
丰田研究院(TRI)团队研究大型行为模型(LBM),在近1700小时机器人数据上训练并大量部署评估。发现LBM性能提升显著,预训练小数据量也能带来增益,预示机器人通用大模型或到来。
北大腾讯突破奖励模型瓶颈!让AI理解人类偏好,泛化能力比肩GPT-4.1
北京大学知识计算实验室联合腾讯等机构提出RewardAnything,突破奖励模型瓶颈。它让奖励模型理解自然语言评判原则,降低成本,泛化能力比肩GPT - 4.1,还能用于定制AI行为模式。
英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了
英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了熵崩溃和训练不稳定问题。
两张图定位全球,o3碾压T0级高手!人类「诡计」被看穿,跨模态推理爆表
OpenAI的o3在GeoGuessr游戏中与大师级玩家Sam Patterson对决,o3通过视觉与搜索推理,忽略伪造EXIF信息,最终以23179比22054获胜,展现出跨模态推理潜力,引发对AI推理能力的思考。