新闻资讯7
马斯克Grok 4跑分泄露,有望改写LLM格局
新智元
AI 摘要
Grok 4跑分泄露,在多项测试中成绩优异,尤其在「人类最后考试」中得分45%远超对手。马斯克称其以「第一性原理」构建,将在7月4日后发布,编码能力或成亮点,但也有人对此存疑。
阅读原文 · 新智元
马斯克Grok 4逆天跑分泄露,「人类最后考试」豪取45%全场第一!
Grok 4跑分提前泄露,在「人类最后考试」中得分高达45%,远超Gemini与Claude,成为当前测试中最强模型之一。马斯克表示Grok 4以「第一性原理」构建推理机制,有望改写LLM格局。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
阿里云平台完成 DeepSeek Harness 评测
本文分享基于阿里云 AgentLoop 平台的 DeepSeek Harness 评测实践。介绍了 DeepSeek Harness 工程架构,阐述 AgentLoop 平台接入方式及价值,还详述评估器设计思路、展示评测结果,最后总结方法论并展望后续工作。
阿里云开发者
新闻资讯7
DeepSeek涨价,马斯克订阅成性价比之王
DeepSeek官发涨价第三天,峰谷定价且整体涨幅大,实际体感比价格表夸张,Opencode go也涨价降额度。而马斯克的Supergrok heavy成全球性价比之王,买它送Cursor ultra,还附赠多项权益。
探索AGI
开源动态7
HarnessEval开启RSI时代新评测范式
过去一年AI进入RSI时代,但评测方式仍停留在过去。MirroS联合多方发布HarnessEval,将Harness引入评测领域,使评测成为具备自我进化能力的智能系统,还率先应用于交互式世界模型评测。
特工宇宙
新闻资讯7
DeepSeek涨价,OpenAI降价,Agent改写价格战
近期,DeepSeek上调API价格,V4 Pro等型号涨幅明显;而OpenAI的GPT - 5.6 Luna API价格降80%,Terra降20%。这背后是大模型价格竞争方向转变,受竞争、广告、效率及Agent使用方式等因素影响。
DeepTech深科技