算法论文7
GPT - 5和Gemini 2.5 Pro国际天文奥赛夺金
机器之心
AI 摘要
新论文用 IOAA 测试大模型,GPT - 5 和 Gemini 2.5 Pro 获奥赛金牌。多数大模型超金牌门槛,GPT - 5 数据分析表现佳。模型在物理数学题表现好,普遍存在概念和几何推理错误。
阅读原文 · 机器之心
大模型追逐星辰大海,GPT和Gemini国际天文奥赛夺金
新论文以国际天文学和天体物理学奥林匹克竞赛 (IOAA) 为基准测试,证明 GPT - 5 和 Gemini 2.5 Pro 能在天文奥赛获金牌。研究还分析不同模型表现、与人类成绩对比及错误类型,强调需全面评估模型科研潜力。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
阿里云平台完成 DeepSeek Harness 评测
本文分享基于阿里云 AgentLoop 平台的 DeepSeek Harness 评测实践。介绍了 DeepSeek Harness 工程架构,阐述 AgentLoop 平台接入方式及价值,还详述评估器设计思路、展示评测结果,最后总结方法论并展望后续工作。
阿里云开发者
开源动态7
HarnessEval开启RSI时代新评测范式
过去一年AI进入RSI时代,但评测方式仍停留在过去。MirroS联合多方发布HarnessEval,将Harness引入评测领域,使评测成为具备自我进化能力的智能系统,还率先应用于交互式世界模型评测。
特工宇宙
新闻资讯7
DeepSeek涨价,OpenAI降价,Agent改写价格战
近期,DeepSeek上调API价格,V4 Pro等型号涨幅明显;而OpenAI的GPT - 5.6 Luna API价格降80%,Terra降20%。这背后是大模型价格竞争方向转变,受竞争、广告、效率及Agent使用方式等因素影响。
DeepTech深科技
开源动态7
macOS Harness:让 AI 操作整台 Mac
macOS Harness 是 browser - use 团队开源项目,目标是让 LLM 用持久化 Python 进程完成 Mac 上几乎所有任务。它仅提供六个原始操作,模型用其操作应用,还能在运行中补全缺失部分。项目有诸多优势,目前仅支持 macOS。
AI工程化