「多模态MoE模型」共找到 7981 篇相关文章
亿级短视频数据突破具身智能Scaling Law!Being-H0提出VLA训练新范式
真机数据匮乏使具身智能VLA模型发展受限,现有真机数据与所需上亿级训练样本相差甚远。BeingBeyond团队提出创新性方案,利用人类视频手部数据构建数据集,训练出VLA模型Being - H0,经实验验证效果良好。
推理即排序:ReasonRank反常识的2.7倍效率跃迁,新SOTA比快更快
论文提出新型排序模型ReasonRank,将深度推理能力融入排序流程,突破数据瓶颈,采用创新训练框架,效率比主流点对点排序模型快2.7倍,还介绍方法论、技术突破、实验验证等内容,指出局限与未来方向。
刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习
腾讯混元团队和复旦联合团队发布姚顺雨署名首篇论文《CL - bench》。论文证实模型在上下文利用上有能力短板,还构建了CL - bench评测基准,评估发现前沿模型在上下文学习上表现差,未来要让上下文学习走向现实。
突破Pass@1瓶颈:一种让LLM自我博弈、永不枯竭的RL新范式,超越基线22.8%!
近年来,基于可验证奖励的强化学习(RLVR)在提升大型语言模型(LLM)推理能力上有关键作用,但存在熵崩溃问题。论文提出SVS创新策略,让模型自我合成变分问题形成自我提升循环,实验效果惊人。
博士学位答辩PPT分享 | 基于机器学习的复杂流场预测方法研究
左奎军博士论文聚焦基于机器学习的复杂流场预测,以多种对象构建智能流场预测网络架构,发展耦合求解方法,剖析核心要素影响,提出多个创新模型和策略,还分析了不同模型在流场预测中的表现与问题。
清华新框架让大模型学会「精读略读」!实现12倍端到端加速,基准评分翻倍
清华等团队提出全新框架RAM,受人类阅读认知启发,将“精读+略读”混合策略引入上下文压缩,突破现有方法效率瓶颈,在多任务上表现出色,实现12倍端到端加速,为长上下文LLM部署提供新范式。
微软发布GUI Agent新范式!告别传统方式,小参数少数据,7B吊打72B模型
微软发布GUI Agent新范式GUI - Actor,告别传统Agent定位死板、缺乏空间感和兼容性差等问题。它用无坐标交互技术,在测试中表现优异,省数据算力,未来在多领域有应用潜力。
ICLR 2026 | 机器人不够聪明?VLMgineer让大模型自己「发明工具」,从设计到使用全自动
宾夕法尼亚大学研究者提出 VLMgineer,一个全自动工具设计与使用框架,利用视觉语言模型和进化搜索,让机器人自主设计并使用工具。该工作已被 ICLR 2026 接收。实验显示,它在工具设计上优于人类提示和现有 Benchmark 工具。
加速近5倍!北大与字节团队提出BranchGRPO,用「树形分叉 + 剪枝」重塑扩散模型对齐
北京大学与字节团队提出 BranchGRPO 新型树形强化学习方法,通过在扩散反演中引入分叉与剪枝,解决扩散/流匹配模型人类偏好对齐难题。该方法在图像与视频生成任务中表现优异,迭代时间最高近 5 倍加速。
图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理
华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。