新闻资讯7
ARC - AGI - 3发布,AI全军覆没遭质疑
AGI Hunt
AI 摘要
ARC Prize发布ARC - AGI - 3预览版,人类轻松通关,AI模型全败。测试范式革新,引发社区质疑测试意义,奖金被嘲少,游戏难度和技术问题也遭吐槽,人类通关率也受质疑。
阅读原文 · AGI Hunt
刚刚,ARC-AGI-3发布!人类100分,最强AI零分
ARC Prize发布ARC - AGI - 3预览版,测试范式从静态谜题到交互式游戏。新引入交互式推理基准测试,人类轻松通关,最强AI却全军覆没。但测试引发社区质疑,奖金设置也遭吐槽,且存在体验和技术问题。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
Stripe70亿收购AI“路由器”OpenRouter
据Bloomberg爆料,16日Stripe敲定收购OpenRouter,超70亿美元。其创始人有成功经验,平台凭借统一API聚合AI模型受开发者青睐,业务增长快,已成AI行业“温度计”,Stripe借此掌控AI调用收支口。
新智元
新闻资讯8
Opus 5通关测试:强模型需简单环境
ARC Prize官方给Opus 5的ARC - AGI - 3成绩为30.2%,但开发者Jeremy Berman让其借助电脑,正确率飙升至96.2%。还开源代码,换用Codex等测试效果差。表明模型强时,简单环境更佳。
新智元
产品应用8
DeepSeek V4 Pro上线,性能追平价仅Claude 2%
2026年8月12日,DeepSeek V4 Pro正式版上线。它是混合专家模型,规模居世界第一梯队。价格比Claude Fable 5便宜超98%,成本优势明显。其架构节省成本,API开放多模式,产品结构清晰。
DeepTech深科技
新闻资讯8
DeepSeek V4 Pro对战Grok 4.6,首测难分高下
梁文锋凌晨发布DeepSeek V4 Pro正式版,马斯克推出Grok 4.6,二者在多项评测中表现出色,直逼OpenAI和Anthropic顶尖模型,还降低了前沿智能价格。首测中,二者在真实任务场难分伯仲。
新智元