测试任务」共找到 3326 篇相关文章

新闻资讯7

GPT-5编程成绩有猫腻!自删23道测试题,关键基准还是自己提的

有人发现OpenAI测试GPT-5编程能力时,用的SWE-bench Verified子集仅477题,自行省略23题。若这些题默认零分,其得分比Claude Opus 4.1低。且该基准还是OpenAI自己提出的。

量子位
新闻资讯7

GLM-5.2真正的跨越:CritPt密闭物理数据集测试得分20.9%,打平Opus-4.8

GLM - 5.2在CritPt密闭物理数据集测试中表现亮眼,与Claude Opus 4.8得分并列,远超其他开源模型,还击败多款闭源模型,实现4.5倍代际飞跃,标志开源模型科学推理能力进步。

AI寒武纪
新闻资讯7

打穿 AI 智商测试!GPT-6 Astra 的符号世界模型,是突破还是钞能力刷分?

OpenAI的GPT-6 Astra亮相,在ARC - AGI - 3测试成绩逼近100%,远超GPT - 5.6 Sol。它生成的符号世界模型被认为是AI迈向高级推理必经之路。不过出题人指出其靠Harness加持,离AGI还远。

AI科技评论
新闻资讯7

GPT-5.6 Sol首批内测结果来了!同任务成本只有Fable 5一半

GPT-5.6 Sol预览版发布半月,首批内测报告出炉。它代码简洁,适合长链路任务,视觉效果好。虽整体略逊Fable 5,但成本近乎减半,且安全限制小,即将全量上线。

量子位
开源动态8

GLM-5.1夺开源模型第一,长程任务更稳,一句话就能生成文章短视频

智谱官宣GLM-5.1开源,代码能力增强,在三项代码评测基准综合平均分上,取得全球模型第三、国产及开源模型第一。它专为长程任务设计,能8小时持续工作,还能一句话生成短视频,是平替Claude Sonnet 4.6的优选项。

AI工程化
开源动态7

代季峰陈天桥联手AGI首秀炸场!最强开源深度研究模型,GAIA测试82.4分超OpenAI

MiroMind ODR是代季峰加盟陈天桥后的技术首秀,GAIA测试82.4分超OpenAI。它全开源可复现,包括MiroFlow、MiroThinker等四个子项目。团队还曾推出MiroMind - M1,专注提升数学推理能力。

量子位
新闻资讯7

GPT-5.2发布即降智?背后华人被挖出,清北校友核心贡献

OpenAI发布GPT - 5.2,官方称其基准测试碾压Gemini 3 Pro,擅长完成有经济价值任务。但发布后实测有翻车情况,也有提前测试者称其很强。此外,背后多位核心贡献者为华人,如北大校友Yu Bai等。

新智元
算法论文8

68页论文再锤大模型竞技场!Llama4发布前私下测试27个版本,只取最佳成绩

《排行榜幻觉》论文指出Chatbot Arena存在问题,如少数大厂私下多版本测试选最优、数据访问不平等、用Arena数据训练可提性能、模型被大量静默弃用等,研究团队给出改进建议,官方也进行了回应。

量子位
算法论文8

斯坦福英伟达推出测试时强化学习:微调开源模型胜过顶级闭源模型,仅需几百美元

斯坦福、英伟达等提出TTT - Discover方法,基于开源模型gpt - oss - 120b,在测试阶段引入强化学习更新模型权重。它采用熵目标函数和PUCT启发机制,解决分布外问题,成本低且表现优,但目前适用于连续奖励场景。

量子位
算法论文8

字节跳动发布SeedFold,蛋白质结构预测相关多任务超越谷歌AlphaFold 3,揭示大模型缩放新秘诀

字节跳动Seed团队推出新一代折叠模型SeedFold,在多个蛋白质相关任务性能上超越谷歌AlphaFold 3。该研究为有效缩放生物分子基础模型提供新思路,推出加宽模型、线性三角注意力等方法。

AI寒武纪