数学基准测试」共找到 2303 篇相关文章

产品应用7

AI 视频生成“试金石”:谷歌 Veo 3 体操“图灵测试”未达标,仍是“抽象派”!

谷歌新出的Veo 3视频生成模型画质惊艳且能开口说话,但生成体操动作效果差,像“抽象派”。虽存在生成不准问题,但物理效果比其他模型好。有人建议其与专业动捕公司合作,音画一体或成视频模型竞赛标配。

AI进修生
新闻资讯8

3晚攻克世界数学难题,黑洞方程秒解!OpenAI:AI正让科学加速100年

2026年,AI成科学家新战友。数学家Ryu用ChatGPT三晚攻克优化难题;物理学者Lupsasca用GPT - 5 Pro 18分钟重现黑洞隐藏对称性;OpenAI为生物领域构建GPT - 4B Micro助力攻克难题。OpenAI称科学加速时代来临。

新智元
新闻资讯8

半世纪难题48小时破解!陶哲轩组队把AI数学玩成打怪游戏了

陶哲轩与多名数学家合作,借助多种AI工具,仅用48小时就解决了尘封50年的Erdős问题。此次解题既有“人与人的协作”,也有“人与AI的协作”,这种方式正成新趋势。

量子位
新闻资讯7

人类秒懂,AI崩溃:一个简单测试,就让GPT-5、Gemini等顶级模型集体“翻车”

来自多机构研究团队发现,OpenAI的GPT-5等顶级AI模型,面对‘看得见但读不懂’文字时表现极差。VYU团队实验显示,人类能轻松读懂的切分拼接文字,AI却全军覆没,原因是其靠模式匹配,不懂文字结构。

量子位
开源动态8

性能逼近闭源最强,通义实验室开源Mobile-Agent-v3刷新10项GUI基准SOTA

通义实验室开源 Mobile-Agent-v3,覆盖多平台,7B 超同类开源,32B 挑战闭源强手。它有基于云环境的全链路开源方案、全栈 GUI 能力构建和可扩展环境强化学习体系,降低部署开销。

机器之心
算法论文7

1万tokens是检验长文本的新基准,超过后18款大模型集体失智

Chroma团队研究发现,将上下文扩展至1万tokens,18款主流大模型集体“失智”,“智商”非均匀下降,在一些节点会断崖式下跌。研究还设计四项对照实验,证明LLMs性能随输入长度增加显著且非均匀下降。

量子位
新闻资讯8

陶哲轩看傻:三破18年数学纪录!谷歌推出「AI爱迪生」,科研不再靠灵感?

5月中旬谷歌发布AlphaEvolve,30天攻克18年未解难题。它利用Gemini模型发现新算法,从AlphaGo获启发,能在编程空间搜索方案,或开启不靠‘灵感’的科学革命,还将改变科学家角色。

新智元
产品应用8

Claude 4发布!AI编程新基准、连续编码7小时,混合模型、上下文能力大突破

今天凌晨Anthropic开发者大会发布Claude 4,含Claude Opus 4和Claude Sonnet 4。前者是顶尖编码模型,后者是Sonnet 3.7重大升级。还发布系列产品,定价不变,已上线Amazon Bedrock。

Founder Park
新闻资讯7

对话微软研究员华文越:横跨数学、哲学与计算机,她如何重构 Agent 的信任基石?

本期访谈邀微软研究员华文越跳出技术视角,探讨如何用跨学科思维解决Agent落地难题,如找模型等间最优解、建信任标准,还将深入其工作逻辑及对Agent未来思考。4月18日直播。

深度学习自然语言处理
新闻资讯7

马斯克官宣数字AI员工!世界首富也来养龙虾,测试阶段员工把它当真人

马斯克在X上宣布数字擎天柱/巨硬AI项目,它是能在电脑自动操作的数字员工,可模拟公司运作。该项目早有记载,此前印度小哥曾爆料。巨硬项目曾遇阻,现以数字擎天柱形式推出,由xAI与Tesla联合打造。

量子位