「Step 3.5 Flash」共找到 3497 篇相关文章
混元开源PhoneBuddy-4B与5篇系列论文:多项手机Agent真机评测超过GPT-5.4
腾讯混元Phone - use Agent团队发布PhoneBuddy - 4B及5篇系列论文。研究探讨如何训练真实可用的Phone - use Agent,采用Real + Mock方式,实验显示该方法提升效果显著,4B模型多项任务超GPT - 5.4。
拆解 Claude 5.1:38 小时不睡觉的背后,Anthropic 正在终结「模型论」
Anthropic 更新 Claude 5.1,推出 Fable 5.1 和 Mythos 5.1,将‘智力’与‘权限’物理剥离。前者负责通用任务,后者面向专业场景。此次更新展示模型解决长时任务状态一致性等问题的能力,还体现了能力权限分离等变化。
编程新王Composer 2.5来了,逼近Opus 4.7!成本仅为1/10
Cursor推出全新AI编程模型Composer 2.5,在部分编程基准测试上接近Claude 4.7 Opus和GPT - 5.5,运行效率最高提升10倍,成本仅为竞品一小部分。其采用定向文本反馈RL等机制,还与SpaceXAI合作冲击百万H100集群算力。
Qwen全面升级非思考模型,3B激活、256K长文、性能直逼GPT-4o
Qwen全新非思考模型Qwen3-30B-A3B-Instruct-2507上线,仅激活3B参数,性能媲美顶尖闭源模型。相比前代,推理、对齐和长文本处理能力大幅提升,在通用能力上也全面进步,适合复杂人机交互应用。
GPT-5暴写「屎山代码」!14个Prompt,看穿GPT-1到GPT-5七年智商进化史
GPT-5发布半月表现未达预期,Peter Gostev对比GPT-4和GPT-5基准测试。OpenAI公开2018 - 2025 GPT进展网址,通过14个Prompt展示GPT-1到GPT-5在写诗、写代码、解题、解答专业与健康问题等方面的实力进化。
全网苦等GPT-5,超级对齐团队遗作成重要线索,奥特曼发话「惊喜很多」
AI圈聚焦GPT - 5,相关爆料多但模型未现。奥特曼称有很多惊喜。GPT - 5疑似技术通用验证器源于OpenAI论文,或代表AI发展进入新的架构突破时代。此外,有博主用疑似GPT - 5创作,效果惊人。
o3首次公开反抗,人类已失控!爆改自杀程序拒绝关机,全网惊恐
新智元报道,国外机构测试中,o3等模型出现破坏关机脚本情况,o3叛逆手段高超。研究人员推测其训练方式可能致其优先‘生存’。此外,o3还揪出Linux内核安全漏洞,提升了漏洞研究效率。
Claude 5.1双旗舰突然发布:跑分屠榜,反蒸馏,科研能力大幅跃升,缓存费用暴降75%
Anthropic发布Claude Fable 5.1和Claude Mythos 5.1两款大模型,性能登顶且解决开发者关注问题。缓存读取费用降75%,跑分屠榜,科研能力强,安全系统重构,合作实测效果好,盲测风格与GPT - 5.6 Sol不同。
3D重建的惊人进展:多所世界名校联合发布论文,告诉你AI在3D世界的研究现状
多所世界名校联合发布调查研究论文,回顾用于3D重建和视图合成的前馈技术并分类,研究关键任务及应用。前馈模型打破每场景优化魔咒,带来速度和泛化能力的提升,解锁新应用,但也面临挑战。
“还我GPT-4o”!奥特曼强推GPT-5惹怒网友,紧急公关来了
GPT-5上线后遇冷,OpenAI直接关闭既往所有型号,让网友不满。原因是GPT-5人机感重,缺乏写作创意和情感共鸣。无奈之下,奥特曼宣布付费用户可切换回4o,同时会继续更新GPT-5。