数学推理测试」共找到 3543 篇相关文章

新闻资讯8

刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS

本文报道上海人工智能实验室等多家机构联合发布智能体模型Atria Dawn Preview,该模型可1分钟预测全球天气、20分钟搭建MiniOS,团队同时分析AI研发中的人机分工,披露最新协作数据。

新智元
新闻资讯8

首批GPT-6内测结果好离谱啊。。。

GPT - 6使用资格分批开放,内测玩家抢先体验。其在3D生成、游戏开发、网页制作等多领域表现出色,如15分钟做出Mac应用,空间推理达世界级水平,但运行时Token消耗大。

量子位
产品应用7

Claude后台接管电脑,真·赛博替身!人机并行时代来了

Anthropic宣布全面升级Claude「计算机使用」能力,操作可在后台完成。该功能处于Beta测试,已向Claude Pro和Max订阅的macOS用户开放。Claude此次更新覆盖多场景,人机并行时代或来临。

新智元
开源动态8

MinerU又开源了!这次专治OCR跨页失忆症

文档解析领域,MinerU团队开源了专门给OCR结果做“后处理”的4B小模型MinerU - Popo。它能把碎成一页一页的OCR结果重新拼成文档级结构,解决了当前OCR跨页逻辑断裂问题,且效果和成本优势突出。

CourseAI
新闻资讯7

突发!Opus 5.1被曝本周发布,最强AI智能体恐大洗牌

消息称Anthropic本周将发布Opus 5.1,其升级聚焦单Token智能水平,强化编程、推理、AI Agent能力;OpenAI 10万亿参数模型Bel完成预训练;企业选模型‘够用就好’,Anthropic Fable 5份额低。

新智元
推荐文章7

AI 能力越来越强,那么它生成的代码,人类还需要去理解吗?

《代码整洁之道》作者罗伯特·C·马丁不逐行看 Agent 代码,设好测试框架通过就行。Notion 工程师 Geoffrey Litt 在会议探讨人类是否需理解代码,多数人认为需要,Litt 分享理解代码方法。

特工宇宙
开源动态8

当「变大」不再是唯一的路,又一国产模型开源了

2026年6月智谱开源GLM - 5.2,心洲科技前沿实验室Mind Lab开源Macaron - V1,基座升级至GLM - 5.2。它押注持续学习与群体智能,成绩优于基座,相关理念和工程路径获验证。

机器之心
算法论文8

ICML 2026获奖论文揭晓:黄高团队获杰出论文,A3C算法获时间检验奖

ICML 2026公布最佳论文奖项,共10篇获奖,涵盖杰出论文奖、杰出立场论文奖等。此次评选严格,经多轮筛选。获奖论文涉及扩散式大语言模型、扩散模型采样算法等多个领域。

机器之心
算法论文8

满分的「差」,Qwen与复旦等揭示编程智能体奖励设计的结构性困境

Qwen团队与复旦等联合发表论文《The Verification Horizon: No Silver Bullet for Coding Agent Rewards》,指出编码智能体奖励设计存在结构性困境,任何奖励信号只是人类意图的‘替身’,验证需成系统与智能体协同演化,并研究多种验证者。

机器之心
算法论文8

CVPR 2026 Oral|横扫室内3D场景,港科大(广州)打造单目开放词汇占据预测新SOTA

具身感知核心难题待解,传统占据预测方法有局限。港科大(广州)陈昶昊教授团队提出 LegoOcc,首次实现单目开放词汇三维占据预测,在多方面展现优势,未来或让家用机器人精准定位目标。

机器之心