「PhyX基准测试」共找到 2049 篇相关文章
Claude悄悄更新了Skills生成器,这绝对是一次史诗级升级。
Anthropic的Claude悄悄更新了Skills生成器Skill - creator,此次是史诗级升级,新增评估系统、基准测试、多代理并行测试、描述调优等4个全新能力,还演示了其使用方法和效果,建议更新并优化评估所有Skills。
「一只手有几根手指」,你的GPT-5答对了吗?
CMU博士生Tairan He测试发现GPT - 5答错‘一只手有几根手指’问题,指出语言难满足视觉与机器人领域需求,需VLM和VLA模型。编辑部测试发现顶尖大模型面对常识问题也会‘翻车’,还探讨了应对方法。
Claude Opus 5刚发布就被玩疯了~
Claude Opus 5刚发布,社区就玩疯了。Anthropic给它定位接近Fable 5,价格仅一半。网友让它与Fable 5、GPT 5.6等做物理场景测试,Opus 5表现不错,但也有不足。官方还给出了其Prompt指南。
死磕即梦48小时,我发现了AI公众号封面的懒人密码
作者与即梦Agent死磕48小时,分享AI公众号封面制作经验。介绍垫图法、两个提示词模板,测试提示词反推、语义理解等功能,指出不足,认为即梦像AI作图界拼多多,瑕不掩瑜。
烧了1万块横测,你用的模型可能掉队了
作者花大成本从后端、人味、前端、推理等维度,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。
DeepSeek识图模式全量上线,却认不出自家老板梁文锋
端午节前,DeepSeek全量推送识图模式。测试发现,它能认出黄仁勋,但忽略‘豆汁’字样,识别人物和潦草汉字准确率低,不过识别文物能力不错。还比较了与其他模型在乐理推理测试中的表现,开发者有新疑问待解答。
大模型IMO25数学竞赛成绩公布了
大模型挑战IMO 2025成绩出炉,Gemini 2.5 Pro以超30%总成绩断崖式领先,超出第二名89%。测试由MathArena组织,采用统一环境和双人匿名评估。还介绍了测试模型、题目及模型表现,人类版结果预计本周六发布。
突发!OpenAI「掀桌」:自研推理芯片「墨西哥辣椒」跑赢英伟达
OpenAI公布自研推理芯片Jalapeño(墨西哥辣椒)测试结果,它专为大语言模型推理设计,能同时提升吞吐量和降低延迟,在多模型测试中超NVIDIA系统。该芯片与Cerebras合作,计划2026年底部署。
o4-mini暴击六大数学天团,攻破陶哲轩难题!4.5h激战人类阵地失守
Epoch AI团队举办竞赛,约40位数学精英分成8组与o4 - mini - medium在FrontierMath基准上对决。o4 - mini击败6组团队,虽未完全超越人类,但Epoch AI预测到2025年底AI可能超30% - 50%人类基准。
豆包要收费了:三档订阅最贵500元/月,保留免费基础版
五一假期时,豆包要收费的消息冲上热搜。苹果App Store已现订阅服务声明,分三档,最贵500元/月,目前仅测试,正式上线会发完整信息,且保留免费版。豆包APP日活、用户新增和规模都断层领先。