「训练推理失配」共找到 3608 篇相关文章
快手&中科院 | 提出多模态奖励模型:R1-Reward,比SOTA模型提升5%-15%!
多模态奖励模型对提升多模态大语言模型表现至关重要,但现有强化学习算法用于训练存在问题。快手、中科院等团队提出 R1 - Reward,在基准上比 SOTA 提升 5% - 15%,还在快手业务场景成功应用。
阿里搞了个全能解析器,文档、图片、音频、视频一锅端
阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。
揭示扩散语言模型扩展定律,人大高瓴团队与蚂蚁集团发布LLaDA MoE v2
中国人民大学高瓴人工智能学院与蚂蚁集团合作,首次系统刻画混合专家扩散语言模型扩展定律,据此训练LLaDA MoE v2,实现扩展效率与智能双重突破,将推动其迈向规模化时代。
波士顿动力Atlas人形机器人再现逆天进化:通用AI机器人真的要来了
波士顿动力为Atlas人形机器人训练全新大型行为模型LBMs,它是语言指令驱动的策略模型,能完成复杂操作任务。构建模型有四步骤,实践遵循三大原则,还展示了其多方面操作能力与特点。
突发!Opus 5.1被曝本周发布,最强AI智能体恐大洗牌
消息称Anthropic本周将发布Opus 5.1,其升级聚焦单Token智能水平,强化编程、推理、AI Agent能力;OpenAI 10万亿参数模型Bel完成预训练;企业选模型‘够用就好’,Anthropic Fable 5份额低。
MIT天才博士刚毕业,就被前OpenAI CTO抢走!年薪或300万起步
MIT天才博士肖光烜刚毕业就官宣加盟Thinking Machines,主攻大模型预训练。他履历耀眼,博士论文破解LLM三大难题,构建高效大模型框架。Thinking Machines薪资可观,平均年薪超OpenAI等公司。
视觉思维链全新架构,加州大学让多模态大模型有了灵性,整体性能提升5.3%
加州大学伯克利分校等团队提出视觉思维链(CoVT)架构,让视觉语言模型推理时生成连续视觉信号。它内化轻量级专家能力,采用对齐策略和四阶段训练,实验显示性能提升,还具可解释性。
100美元、8000行代码手搓ChatGPT,Karpathy最新开源项目爆火,一夜近5k star
AI大神Andrej Karpathy发布开源项目nanochat,可教你100美元自建ChatGPT,覆盖LLM训练和推理。项目有8000行代码,不到12小时获超4500 star,功能丰富,但他认为它不适合个性化应用。
阿里达摩院开源多模态医学大模型—灵枢
大模型在医疗领域应用有医疗知识覆盖不足、幻觉风险高、推理能力欠缺三大难题。阿里达摩院开源统一多模态医学大模型灵枢,介绍其数据体系、清洗流程及四阶段强化训练方法。
NextStep-1:一次在图像生成上自回归范式的探索
阶跃星辰团队探索自回归图像生成新路径,推出 NextStep-1。它直接在连续视觉空间自回归生成,架构简洁,实现端到端训练。模型有高保真生成和编辑能力,Benchmark 表现佳,但也面临稳定性等挑战。