「多模态统一建模」共找到 1461 篇相关文章
从VLA到RoboOmni,全模态具身新范式让机器人察言观色、听懂话外音
复旦大学等联合推出全模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现全面领先。
太强了 Yan!腾讯打造的全能交互视频生成引擎
腾讯提出的面向交互式视频生成的基础性框架 Yan,集 AAA 级模拟、多模态生成和多粒度编辑于一体,为下一代 AI 内容引擎提供可行路径,但也面临长时视频视觉一致性不足等问题。
阿里达摩院开源多模态医学大模型—灵枢
大模型在医疗领域应用有医疗知识覆盖不足、幻觉风险高、推理能力欠缺三大难题。阿里达摩院开源统一多模态医学大模型灵枢,介绍其数据体系、清洗流程及四阶段强化训练方法。
百度搜索变天了:怎么搜索你们定
百度 App 搜索框大改版,升级为智能框,支持多模态输入,降低使用门槛。还推出多项功能,如百看、智能创作、深度搜索等,接入 MCP 服务,推动产品能力多方面转变,探索新盈利模式。
ICLR 2026 | 异常需要定义!中传团队提出开放世界视频异常检测新范式
现有视频异常检测(VAD)方法泛化能力不足,无法适应开放世界需求。中传吴晓雨团队在ICLR 2026发表论文,提出LaGoVAD模型,联合建模视频与异常定义,解决样本密度下降等问题,实验显示泛化性强。
微信测试中心刷新业界标准,斩获 ICCV 图像质量评估挑战赛冠军
微信测试中心IH-VQA团队在ICCV 2025 MIPI赛事夺冠,其首创的iDetex方案刷新业界标准。该方案能精准定位图像失真,提升评估可解释性,已在微信多业务落地,未来将深耕多模态质量评价等领域。
GPT-5刚刚正式发布,首次面向免费用户开放
OpenAI正式发布GPT - 5,有架构统一、性能大幅提升、全用户开放三大核心变化。测试数据显示性能进步明显,采用新定价策略面向所有用户开放。但演示未带来突破感,编程能力还面临Claude Opus 4.1挑战。
Tool-Star:赋予大模型结合多工具推理的能力
文章提出Tool - Star框架,旨在解决大模型多工具协作推理难题。它从数据端到训练流程优化,让模型调用多种工具,在复杂计算和知识型推理任务表现卓越,还探讨了未来多模态及多工具扩展方向。
本地Opus你要不要!Qwen3.8-27B开源
阿里Qwen团队开源Qwen3.8-27B,上线2天登顶Hugging Face全球大模型趋势榜,下载破百万。其性能超Opus4.6,与顶尖模型相当,量化后普通电脑就能跑,原生多模态,编程、Agent、多模态跑分表现出色。
从打分器到思考者:RM-R1用推理重塑模型价值判断
伊利诺伊大学香槟分校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在多基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。