产品应用8
大神评GPT-5.2:强但慢,各有分工
AI寒武纪
AI 摘要
OthersideAI CEO Matt Shumer:GPT - 5.2指令遵循、代码生成等能力提升,幻觉减少,但速度慢。日常任务用Claude Opus 4.5,深度研究用GPT - 5.2 Pro,前端UI可选Gemini 3 Pro。
阅读原文 · AI寒武纪
GPT-5.2首发评测:大神深度体验两周,强到离谱,但慢得抓狂
为对抗谷歌的Gemini 3,OpenAI推出GPT - 5.2。大神Matt Shumer深度评测,指出其指令遵循、代码生成、视觉和长上下文等能力有提升,但速度慢。与Claude Opus 4.5、Gemini 3 Pro各有分工。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
马斯克:AI直出二进制,大佬集体回怼
马斯克在X上称代码正变成下一个汇编,要让AI直接生成二进制,摒弃“源代码”。此言论引发争议,UML之父、《代码整洁之道》作者等教父级人物纷纷回怼,而现实中AI生成代码已成趋势。
新智元
新闻资讯7
Karpathy:Opus 5 10 美元造出中土 3D 世界
Andrej Karpathy 用 Opus 5 结合《指环王》开篇文字,花约 10 美元让其渲染 3D 游戏。Opus 5 两小时写出 5500 行代码生成 3D 世界,虽粗糙但证明 AI 强大。不过,LLM 无法高效审查自己工作,这是弱点。
新智元
开源动态7
Stripe测试:AI智能体校验环节有短板
Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。
InfoQ
算法论文8
人大DelTA算法提升强化学习推理正确率
人大高瓴研究团队提出DelTA算法,不依赖经验为强化学习目标中每个token算最优权重。实验显示它适配主流强化框架,在多任务上提升base模型效果,还能让训练更稳定。
量子位