「o4 mini」共找到 1728 篇相关文章
断网解题,Claude Mythos推翻Erdős 80年猜想!比OpenAI更短更漂亮
OpenAI用125页思维链解开Erdős 80年猜想,Anthropic研究员Levent Alpoge让Mythos断网测试,找到更短更简洁路径。Mythos用数论方法打破僵局,过去一周OpenAI、DeepMind、Anthropic分别攻克相关难题。
撕开Claude Code真相:让它好用的98.4%,是工程不是AI
X用户推文曝光Claude Code项目模板,实则是公开范式。研究显示Claude Code 98.4%是工程基建。OpenAI等团队已将AI编程跑成生产线,普通开发者也能搭建入门版基建。
英伟达4B小模型击败GPT-5 Pro!成本仅1/36
英伟达ARC - AGI 2中,4B小模型NVARC以27.64%成绩力压GPT - 5 Pro登顶,单任务成本仅其1/36。亮点是零预训练深度学习法,还靠合成数据、测试时微调等策略。小模型特定领域优化后优势明显。
刚刚,GPT-5.4核心内幕炸裂剧透!或拥有永久记忆,极限推理狂飙
多方消息显示GPT - 5.4已开启测试,多次意外曝光。它或有极限推理模式、翻倍上下文、长任务表现佳,甚至可能拥有永久记忆。OpenAI因对手紧逼,模型更新接近月更。
Anthropic发布Claude Sonnet 4.5:编程能力再登顶,新产品试图颠覆Windows操作系统
今日凌晨Anthropic发布Claude Sonnet 4.5,该版本在编程、计算机使用等能力上显著提升,开放Claude Agent SDK,还推出多项产品功能更新及“Imagine with Claude”研究预览,或对AI编程和Agent产品洗牌。
智谱发布GLM 4.5,不仅开源模型还把训练框架也开源了
智谱AI发布GLM 4.5,不仅开源模型,还开源整套后训练基础设施。模型规格亮眼,性能也超越qwen 235b。其开源的训练框架slime专为强化学习扩展设计,完整工具链支持多种模型。
2025全球大模型应用报告:红海混战「忠诚度」瓦解,用户脚踏4.7条船!
2025年上半年大模型从技术走向生产,45%企业将其用于生产环境。用户付费方式多样,使用面临知识不足、成本高的挑战。市场红海竞争,用户平均用4.7家大模型,国产模型出海需借第三国。
DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危
据爆料,DeepSeek计划在2月中旬春节前后发布V4模型,剑指编程王座。其在编程能力、超长上下文代码处理、算法提升、推理能力上有突破,或延续高性价比路线,在受限硬件下靠算法取胜。
马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?
Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。
一个问题几百美元,DeepMind智能体一次搞定了9个Erdős问题
DeepMind团队的大模型在一次‘测试’中解决9个开放的Erdős问题,还自动验证,解法通过人工审查。其框架AlphaProof Nexus结合大模型与Lean编译器,研究展示了AI辅助正式证明搜索技术潜力。