「成本优化」共找到 2573 篇相关文章
Claude Fable 5.1与GPT-5.6社区一手实测
Anthropic的Claude Fable 5.1刚上线,社区就将其与OpenAI的GPT - 5.6 Sol实战对决。采用同一提示词等严苛规则,结果Fable 5.1细节碾压但有bug,成本高;GPT - 5.6 Sol成本低、风格稳定。还给出选型参考。
通过零开销逐层权重卸载技术将SGLang Diffusion wan2.2的推理速度加速60%
文章介绍在优化SGLang对Wan2.2视频生成模型支持时,发现双Transformer架构下第1步和第19步推理慢的问题。通过零开销逐层权重卸载技术,将整体推理速度提升60%,还突破显存墙,且该优化可扩展到其他模型。
小模型大作为!微博的VibeThinker-1.5B超越DeepSeek R1等头部大模型
近年来,“参数越大,能力越强”成行业共识,但带来成本高和资源集中问题。微博AI团队开发的VibeThinker - 1.5B用1.5亿参数和低训练成本,在多项测试中超越头部大模型,还提出SSP框架和MGPO算法。
FlashAttention 完全进化史:FA-4 发布之际的技术全景回顾
文章围绕FlashAttention展开,从Attention性能瓶颈引出问题,阐述其各版本演进。FA-1实现算法突破,避免O(N²)内存;FA-2适配架构,提升性能;FA-3深度协同,实现异步;FA-4探索更深异步和角色分工。还探讨跨芯片迁移及未来优化方向。
究竟会花落谁家?DeepSeek最新大模型瞄准了下一代国产AI芯片
近期,DeepSeek发布V3.1新模型,采用全新混合推理架构,在多任务表现上有提升。它采用UE8M0 FP8,或为国产推理芯片优化机制。国内多家厂商新一代AI芯片支持FP8,未来国产大模型或针对其专门优化。
AutoResearch-LLM:让 Agent 接手 LLM 训练优化
本文是 LLM 微调 AutoResearch 落地实战。作者将电商场景 Qwen3 微调流水线沉淀成 Agent 驱动的三阶段框架,还分享踩坑经验。思路方法与平台无关,可类比到外部环境,适合关注 AI Coding 等的同学。
OpenAI:我们正朝着什么方向优化 ChatGPT?
OpenAI 官网文章称,ChatGPT 发展方向是成‘对你有用’的工具,不追逐 DAU 或让用户沉迷。它介绍了有用的使用场景,还提及健康使用方面的改进及与专家合作提升响应能力等内容。
The Batch: 906 | AI 巨头分担维基百科的成本
维基百科成立25周年,维基媒体基金会与Amazon、Meta等多家AI公司达成合作,推出Wikimedia Enterprise计划,允许合作方高速大规模访问数据。维基百科需资金支持,AI公司也需其数据训练模型。
库克不忍了!挥刀优化苹果AI大总管
苹果官宣AI负责人John Giannandrea卸任,其领导下苹果AI团队落后同行,新版Siri推迟发布。同时,苹果从微软挖来Amar Subramanya出任AI副总裁。此外,苹果机器人技术负责人Yilun Chen跳槽特斯拉,军心涣散。
Harness Engineering: C 端 AIGC 内容生产自优化实践
文章介绍蚂蚁保保险快查深度解读页面生成系统(DIPG),它将Harness思想用于C端AIGC生产链路。DIPG采用‘离线生成+校验+刷入DB’模式,解决LLM实时生成时延和质量问题,还阐述多Agent协作、校验机制及回灌流程等。