新闻资讯7
大模型解数独正确率仅15%
量子位
AI 摘要
Sakana AI公布大模型解数独排行榜,用Sudoku - Bench测试。结果大模型总体正确率低,9×9数独表现差,多数模型靠记忆而非推理,仅ChatGPT o3能解所有谜题。
阅读原文 · 量子位
大模型玩不好数独?!Transformer作者初创公司公布排行榜:o3 Mini High“变异数独”正确率仅2.9%
Transformer作者初创公司Sakana AI公布AI解决数独能力排行榜,用全新基准Sudoku - Bench考验大模型创造性推理能力。结果显示大模型总体正确率仅15%,9×9数独中高性能模型o3 Mini High正确率2.9%。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
阿里Qwen3.8-Flash发布,性价比惊人!
8月大模型厂商多上调API价格或收缩免费额度,因推理需求增长跑赢算力供给。阿里发布Qwen3.8-Flash并开源,成绩亮眼且价格低。它是Qwen4架构预演,有四大技术创新,提升了模型效率。
机器之心
新闻资讯8
OpenAI自研芯片性能超英伟达,2026年部署
8月25日,OpenAI公布自研推理芯片Jalapeño性能测试结果,首次给出其在多款公开大模型上的具体数据。该芯片在低功耗下实现高推理吞吐量和低延迟,性能超英伟达芯片,B0版已进入制造阶段。
DeepTech深科技
算法论文8
颜见智团队:启发学习让大模型自我进化
当下大模型能力多靠人为框架,能力上限受限。文章提出“启发学习”,将其集成到推理侧成Isaac框架,通过Prompt与网络层注入复用旧经验,实验显示能大幅提升大模型任务性能。
机器之心
新闻资讯7
Marin 535B模型公开训练,吴恩达力挺!
当多数模型公司还在争论是否开放权重时,斯坦福大学的Marin项目启动535B-A23B模型训练,并公开训练过程。该项目旨在探索基础模型能否像开源软件一样被公开研究和建设,引发关注。
InfoQ