超人类灵活性」共找到 3132 篇相关文章

算法论文7

多模态模型具备“物理推理能力”了吗?新基准揭示:表现最好的GPT-o4 mini也远不及人类

来自多机构研究人员构建PhyX基准测试,评估多模态模型物理推理能力。测试显示,即便表现最佳的GPT - o4 mini准确率仅45.8%,远不及人类的75.6%,且模型在多方面存在结构性缺陷。

量子位
开源动态8

DeepSeek出品,必是精品!DeepSeek-OCR 2发布:让LLM像人一样读懂复杂文档,效果Gemini 3 Pro

DeepSeek推出DeepSeek-OCR 2,提出“视觉因果流”,以全新视觉编码器赋予模型因果推理能力。它在文档解析基准表现Gemini 3 Pro,代码和模型权重已开源,为2D推理和原生多模态探索铺路。

AI寒武纪
算法论文8

人类打辩论不如GPT-4?!Nature子刊:900人实战演练,AI胜率64.4%,还更会说服人

瑞士洛桑联邦理工学院等机构研究人员让900名美国参与者与人类或GPT - 4就社会议题辩论。发现GPT - 4知晓对手信息时胜率64.4%,说服效果提升81.2%,低/中争议话题更易受其影响。

量子位
算法论文8

仅看视频就能copy人类动作,宇树G1分分钟掌握100+,UC伯克利提出机器人训练新方式

UC伯克利团队研发出名为VideoMimic的新系统,能将视频动作迁移到真实机器人。它已让宇树G1模仿100多段人类动作,还能适应各种地形。其工作流程含视频转仿真、仿真训练策略、策略迁移到实体机器人。

量子位
算法论文8

人类专家快2倍,斯坦福联合英伟达发布TTT-Discover:用「测试时强化学习」攻克科学难题

斯坦福与英伟达等机构联合提出 TTT - Discover 方法,让 LLM 在测试时强化学习。它在多任务上成绩出色,如在数学、GPU 内核等领域人类和其他 AI,计算成本低,或为持续学习打开新空间。

机器之心
开源动态8

混元开源PhoneBuddy-4B与5篇系列论文:多项手机Agent真机评测过GPT-5.4

腾讯混元Phone - use Agent团队发布PhoneBuddy - 4B及5篇系列论文。研究探讨如何训练真实可用的Phone - use Agent,采用Real + Mock方式,实验显示该方法提升效果显著,4B模型多项任务GPT - 5.4。

量子位
新闻资讯8

对话谷歌前 CEO Eric Schmidt:数字智能将在十年内到来,AI 将创造更多更高薪的工作

谷歌前 CEO Eric Schmidt 做客播客,探讨 AI 未来。他认为 AI 被严重低估,数字智能十年内或到来,瓶颈是电力。还谈及 AI 对就业、商业、教育等方面的影响,以及潜在风险和应对建议。

AI科技大本营
开源动态8

4B小模型数学推理首Claude 4,700步RL训练逼近235B性能 | 港大&字节Seed&复旦

香港大学NLP团队联合字节跳动Seed、复旦大学发布Polaris强化学习训练配方,让4B模型数学推理能力商业大模型,且Polaris-4B可在消费级显卡部署,相关内容已全部开源。

量子位
算法论文7

多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合

清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。

量子位
新闻资讯7

OpenAI杀疯了!「星际之门」刚宣布将提前实现:英伟达有望成为地球第一个市值10万亿美金公司

OpenAI、甲骨文和软银联合宣布在美国新增五个AI数据中心站点,支持“星际之门”计划,提前实现相关承诺。涉及4000亿美元新增投资,由不同合作体系推进,选址经严格筛选,后续还有更多站点加入。

AI寒武纪