「大模型成本」共找到 9923 篇相关文章
不用花Anthropic API的钱,本地跑Qwen3.5就能用Claude Code
文章介绍不花Anthropic API的钱,用本地Qwen3.5跑Claude Code的方法。包括选模型、编译安装llama.cpp、下载量化模型、启动本地服务、配置Claude Code指向本地服务等步骤,还提及踩坑建议和使用方法。
被曝蒸馏DeepSeek还造假!欧版OpenAI塌房了
被誉为欧洲版OpenAI的Mistral被离职员工爆料多项黑幕,其最新模型疑似直接蒸馏自DeepSeek,却包装成RL成功案例,歪曲基准测试结果。此前就有人发现其模型与DeepSeek相似,目前官方暂无回应。
半年复盘,AI迎来预训练后的新瓶颈。
2025年上半年AI领域发展加速,编码和多模态能力提升。但模型在综合能力上遇到第二轮瓶颈,编码能力强时通用认知能力‘拉胯’,或与RL阶段使用编程数据有关,红杉新基准或推动模型均衡发展。
企业为什么越来越花钱买闭源模型?Decagon CEO 提出了一个很重要的新观点
Decagon CEO Jesse Zhang 提出新观点,未来 AI 会形成产业分工,闭源负责探索,开源负责规模化生产。企业市场开源模型 LLM 支出占比下降,因多数企业处探索阶段,还分析了未来 AI 行业的重要变化。
Claude Code、Cursor 可能都躲不过一次“大重写”,但 OpenCode 也许是例外
文章指出Claude Code、Cursor等AI编程工具因开发方式问题,代码库陷入难逆转状态,或迎“大规模重写潮”。而OpenCode强调代码一致性,代码库更干净。其创始人分享开发经验、工作流及对行业现象的看法。
传言:中国AI 公司人肉运硬盘到马来西亚训练模型,美国芯片禁令形同虚设?
《华尔街日报》传言中国AI公司工程师人肉运硬盘到马来西亚训练模型。美国芯片禁令下,中国公司难进口先进硬件,采用复杂方式规避。任正非和黄仁勋都认为可集群补单芯片性能,美国制裁效果堪忧。
Kimi开源新线性注意力架构,首次超越全注意力模型,推理速度暴涨6倍
月之暗面发布开源Kimi Linear架构,用新注意力机制首次超越全注意力模型。长上下文任务中,它减少75%的KV缓存需求,推理加速达6倍。核心创新Kimi Delta Attention有细粒度遗忘门控等特点。
OpenAI IMO金牌团队爆料:AI拒绝作答第六题
OpenAI IMO团队接受采访,透露让模型获IMO金牌的项目仅用两三个月、核心开发者仅三人。还谈及模型证明风格、第六题失分原因、解决千禧年大奖难题距离等,强调通用技术及面临的新挑战。
Alibaba力作:Ovis-U1 融合理解、生成与编辑,解锁无限可能
OpenAI 2025 年推出的 GPT - 4o 结合图像与语言能力,但引发视觉解码器设计及统一模型训练问题。Alibaba 力作 Ovis - U1 单一模型能完成理解、生成与编辑任务,介绍了其架构、训练过程和应用。
以星为舵:LLM的Post-Train与Rest-Time奖励学习综述
这篇论文提出奖励信号像AI的“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期的三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。