「大模型预训练」共找到 9494 篇相关文章
华为攻克AI推理「想太多」问题!新方法让大模型推理提速60%,准确率还高了
华为提出高效推理方法S - GRPO,突破思维链「冗余思考」瓶颈。通过“串行分组 + 衰减奖励”设计,在Qwen3上有效,推理提速60%,生成答案更精确有用,在多个推理benchmark测评中表现出色。
世界模型的GPT时刻:距离物理AGI出圈,还有多远?
InfoQ《极客有约》X AICon 直播栏目探讨物理 AI 下一个战场。嘉宾认为世界模型未出圈,生成加重建是折中探索。还讨论了其定义、升温原因、数据结构、技术范式、评测标准等,也提及挑战与未来格局。
抛弃“级联”架构!快手OneRec用大模型重构推荐系统,服务成本降至1/10
传统级联式推荐架构有瓶颈,快手用OneRec重构推荐链路,服务成本降至1/10。文中介绍OneRec架构、Tokenizer方案、强化学习奖励设计,还提及优化及多模态联合训练方向。
大模型思维链推理速度倍增!——RoT新框架把思维链「画」进隐空间
随着大模型规模扩展,思维链(CoT)成处理复杂推理任务标准范式,但显式CoT依赖长序列生成,隐式CoT面临优化挑战。腾讯提出RoT新框架,利用视觉编码器将文本推理步骤转为视觉嵌入,实现Token压缩与推理加速,且过程可分析。
港大×复旦×上交:视触觉融合+闭环纠错,让机器人双臂协作不再「盲操」
港大联合复旦、上交大提出TAMEn,在UMI框架上全方位升级,构建视触感知融合等数据闭环,打通数据采集到再训练链路。其三层闭环让机器人学得更快准高效,在双臂协作任务中提升成功率。
Meta详细阐述基于LLM级训练、混合并行计算与知识迁移的GEM广告模型
Meta发布生成式广告模型GEM详细信息,旨在改善平台广告推荐能力。它处理海量用户 - 广告交互数据,用三种方法构建系统,还实施GPU级优化,采用两种知识迁移策略,获业内人士认可。
token危机解决?扩散模型数据潜力3倍于自回归,重训480次性能仍攀升
新加坡国立大学AI研究者Jinjie Ni团队预训练扩散语言模型(DLMs)与自回归(AR)模型,发现DLMs是超强数据学习者,数据潜力超AR 3倍,重训480次性能仍攀升,还剖析同期研究方法论缺陷。
Sebastian Raschka 新书《从头开始推理》抢先看,揭秘推理模型基础
著名AI技术博主Sebastian Raschka新书《Reasoning From Scratch》第一章介绍LLM中推理含义、训练阶段、模式匹配与逻辑推理区别,还讲述提升推理能力方法及从头构建推理模型的重要性等内容。
一人公司火了,但Chatbot不是最大机会 | 不是 for 人,而是 for Agent 。
在2026中关村论坛上,天工AI发布三大核心模型,公布昆仑万维AGI战略。天工AI董事长周亚辉在对话中谈中国大模型竞争力、企业出海、产品价格等问题,认为企业级Agent是更大金矿。
KDD 2025 | UoMo来了,首个无线网络流量预测模型,一个框架搞定三类任务
在 ACM KDD 2025 大会上,清华与中国移动联合发布 UoMo,全球首个面向移动网络的通用流量预测模型。它结合扩散模型与 Transformer,能理解地理与人流变化,一个框架搞定三类流量预测任务。