「模型用量排行榜」共找到 7805 篇相关文章
30天狂刷60万亿Token,光“榜一”就烧掉140万美元!Meta员工搞出“AI Token排行榜”,结果小扎连前250都进不了?
Meta员工开发“Claudeonomics”仪表盘统计员工AI Token使用量,引发“Tokenmaxxing”风潮,上线两天因数据“外泄”下线。30天内全公司Token使用超60万亿,“榜一”花超140万美元,扎克伯格未进前250。
训练效率提升25%、成本降23%!上海期智研究院、算秩未来联合推出MegatronApp:专为万亿参数大模型训练打造的系统工具包
上海期智研究院联合算秩未来在WAIC 2025大会发布开源项目MegatronApp,它是国内首个围绕Megatron - LM的增强工具链。经实际数据,其在该框架下训练效率提25%、成本降23%,含四大模块解决训练难题。
超越英伟达B200!AMD最强AI芯:1.6倍大内存、大模型推理快30%,奥特曼都来站台
AMD发布最强AI芯片MI350X和MI355X,号称大模型推理比英伟达B200快30%,内存是其1.6倍。该系列本月初已批量出货,还发布ROCm 7软件栈。AMD还预告明年推MI400系列,由其与OpenAI联合研发。
Gemini 3预训练负责人警告:模型战已从算法转向工程化!合成数据成代际跃迁核心,谷歌碾压OpenAI、Meta的秘密武器曝光
2025年底大模型“年终决战”,Gemini 3强势突围。其预训练负责人Sebastian Borgeaud指出,谷歌转向“做系统”,AI进入“数据有限”阶段,合成数据等构成未来进化路径,还分享了预训练热点与挑战。
更全面的具身智能真机评测来了!CVPR 2026 ManipArena挑战赛邀你打榜
具身智能产业发展迅速,但缺统一、高标准真机评测体系,成发展痛点。中山大学等机构推出 ManipArena 挑战赛,提供科学评测框架,已测部分模型,揭示不同技术路线能力边界,为产业发展提供基础。
Anthropic新模型杀疯了!成本直降 2/3、性能直逼GPT-5,用户实测:比“吹”的还强,速度超 Sonnet 3.5 倍
Anthropic发布Claude Haiku 4.5版本,成本降2/3、性能逼近GPT - 5,速度超Sonnet 3.5倍。该模型已全平台上线,可处理大文件,安全对齐性佳。它能与Sonnet协同,适用于企业与软件开发,Anthropic业务也在爆发式增长。
Qwen3.5实战教程:从0到1掌握本地部署与微调
阿里通义千问团队发布Qwen3.5系列小模型,打破“大模型=高成本”惯例。本文全面剖析该系列模型,涵盖核心特性、本地部署实战、模型微调实战,还给出技术细节与问题解决办法。
刚刚,加入腾讯的姚顺雨发表首篇Paper~
腾讯混元与复旦联合发表论文《CL-bench》,姚顺雨署名并全面细致审阅反馈。CL-BENCH 首次单独考‘现学现卖’,有独特设计原则、四大题型,其评分杜绝‘差不多’,还让 10 个前沿模型‘翻车’。
Mamba核心作者新作:取代DeepSeek在用的注意力机制,专为推理打造
Mamba核心作者Tri Dao团队提出GTA和GLA两种专为推理定制的注意力机制,在减少KV缓存用量、保持模型质量的同时,显著提升解码速度,优化长上下文推理能力。
微软叫停Tokenmaxxing!预算卡死,超限自负
从今年7月起,微软为各业务部门设「AI Token预算目标」,将GPT - 5.6设为内部默认模型。此前Tokenmaxxing风靡硅谷,如今大厂纷纷收紧AI使用,微软是最后跟进者之一。