「模型发布」共找到 8914 篇相关文章
奥特曼摊牌:别再比模型跑分了,苹果才是真宿敌
2025年模型发布密集,但方向一致在补短板,更像基础设施建设。2026年各玩家或集体解锁,真正换代要让AI成文明基础设施。奥特曼称OpenAI长期对手是苹果,还拉Jony Ive造秘密设备。
2025 年中丨大模型市场分析报告
这是《2025年中丨大模型市场分析报告》。指出基础大模型塑造计算未来,企业重心转向推理。Anthropic超OpenAI成市场头号玩家,开源模型采用趋缓,企业换模型重性能,AI支出从训练转向推理。
刚刚,全球首个超高帧世界模型诞生!英伟达含量0,狂飙50帧
魔芯科技联合浙大潘云鹤院士团队发布全球首个Flash World Model——MoWorld,全栈基于国产NPU,实现50FPS实时推理,推理成本降70%,为世界模型产业化带来新思路。
Sam Altman:即将推出远超预期的开源模型,ChatGPT记忆功能正在实现《Her》的愿景
Sam Altman在对话中透露OpenAI将发布‘远超预期’开源模型,分享创立初期挑战,明确GPT - 5等演进方向,展望AI伴侣、机器人发展,还向创业者喊话,强调AI用于科学前景。
超棒Claude官方提示词:Anthropic发布Claude 4.x提示工程最佳实践
Anthropic发布Claude 4.x提示工程最佳实践,这些原则在顶尖大模型中一般通用。它强调精准指令驱动性能,构建记忆与状态管理机制,优化工具调用编排,激发高阶认知与专业输出,重塑代码美学与工程规范。
同一个模型,换套框架成绩差27%:SWE-bench分数到底谁说了算?
编程Agent评测是笔糊涂账,SWE - bench虽成事实标准,但分数不适合直接横向比较。基元律动等机构发布Claw - SWE - Bench基准,将模型、harness和任务集拆分,通过实验揭示harness对成绩影响大,还解决通用Agent评测问题,推出低成本Lite版。
“最强编码模型”上线,Claude 核心工程师独家爆料:年底可全天候工作,DeepSeek不算前沿
Anthropic 开发者大会发布 Claude 4 ,含 Opus 4 和 Sonnet 4 型号,在基准测试表现出色。核心工程师预测年底软件工程智能体能力,谈 RL 及 DeepSeek,还提到模型自我意识、推理计算瓶颈等问题。
DeepSeek-V3再发论文,梁文锋署名,低成本训练大模型的秘密揭开了
DeepSeek 发布围绕 DeepSeek-V3 的技术论文,从硬件架构和模型设计双重视角,探讨实现经济高效的大规模训练和推理的方法。介绍了 DeepSeek-V3 的创新设计,如 DeepSeekMoE 架构、MLA 架构等,还给出未来硬件架构设计建议。
Claude Code发布4个月,用户已经11.5万了,开发者:200 美元/月不算贵
Anthropic的Claude Code发布4个月吸引11.5万开发者,一周处理1.95亿行代码。它集成Claude Opus 4模型,功能实用,口碑好,让开发者觉得物有所值,反映开发者对AI编程工具接受度提升。
从RLHF、PPO到GRPO再训练推理模型,这是你需要的强化学习入门指南
强化学习是当今LLM重要技术,Unsloth团队发布教程,从吃豆人谈起,介绍RLHF、PPO到GRPO,分享用GRPO训练推理模型技巧,涵盖相关概念、训练方法及奖励函数设计等内容。