新闻资讯7
Grok 4刷新ARC-AGI-2纪录,离AGI还有多远?
AGI Hunt
AI 摘要
xAI的Grok 4在ARC-AGI-2测试中成绩优异,成最强公开模型,打破噪声屏障。但网友质疑测试指标,且其离人类表现差距大。它在多测试领先,定价便宜,马斯克赞其能力强。
阅读原文 · AGI Hunt
Grok 4刷新ARC-AGI-2纪录:15.9%碾压所有公开模型,我们离AGI还有多远?
xAI的Grok 4在ARC-AGI-2测试中获15.9%,成全球最强公开AI模型。ARC Prize主席还原测试过程,虽成绩亮眼,但网友有质疑,且离人类表现差距大。Grok 4在多基准测试领先,定价便宜。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
ASI - Bench:测AI距自主科研有多远
ASI-Bench是衡量AI系统科学自主性的基准测试,由多机构联合开发。它能测试AI通用智能、创新性和执行力,通过信息梯度设计,让模型在不同指导量下完成科研任务,结果显示当前AI离自主科研有明显距离。
机器之心
新闻资讯8
Ilya SSI或本周发模型,预训练时代要终结?
Ilya Sutskever创立的SSI或本周发布首个重磅模型,引发圈内关注。英伟达砸50亿美元合作,提升其算力。该模型基于测试时训练架构,能边学边进化,或终结大模型“预训练时代”。
新智元
新闻资讯7
Hugging Face拟出售,估值达130亿美元
重要AI开源平台Hugging Face正探索出售,估值或达130亿美元。消息引发对开源生态的担忧,此前微软收购GitHub就曾让部分人迁移代码。它从聊天机器人转型,近年还扩张到硬件等领域。
新智元
新闻资讯7
J-Space让V4 Pro超Fable 5?测试结果翻车!
前两天J-Space凭夸张测试结果刷屏,宣称一份Skill接入Agent环境,能让V4 Pro在多基准大幅提升,部分成绩超Fable 5。但社区复测结果相反,作者未公开完整评测记录,还删质疑帖,引发公开打假。
机器之心