多模态处理能力」共找到 4420 篇相关文章

算法论文8

从平面几何出发:形式化验证如何驱动MLLM的推理能力跃迁

多模态大语言模型在复杂数学与几何推理中有缺陷,现有训练方式让模型难有鲁棒推理能力。上海交大等团队提出“以形式化增强非形式化推理”方案,构建完整闭环,提升模型推理及泛化能力

机器之心
开源动态8

多模态思维链如何重塑 AI 与短视频的未来

传统多模态模型在动态视频理解与复杂推理场景面临挑战,快手开源的 Keye-VL 模型在多模态思维链技术实现突破。文章解析其核心技术,分享在快手短视频社区的落地应用,还探讨了未来“Think with Video”的技术方向。

AI前线
算法论文8

ERNIE 5.0:走向原生统一的万亿参数多模态基础模型

过去多模态模型‘拼接式’方案存在理解与生成割裂问题,ERNIE 5.0 借此提出,用统一自回归框架做多模态理解与生成,在架构、训练与系统层面有创新,评测中各模态能力表现出色。

深度学习自然语言处理
新闻资讯7

疯狂……韩国开发出强大的核灾难处理人形机器人。丑,但实用

韩国原子能研究院正开发用于核灾难响应和废料处理的人形机器人,目标是能举200公斤重物。与其他机器人相比,其举重能力优势明显。不过在真实核灾难现场应用还需长期测试。

AGI Hunt
算法论文8

单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器

人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。

新智元
算法论文8

打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力

如今视觉语言模型在长上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM长度泛化能力

机器之心
新闻资讯7

AI 编程冲击来袭,程序员怎么办?IDEA研究院张磊:底层系统能力才是护城河

在AICon全球人工智能开发与应用大会上,IDEA研究院张磊接受专访,剖析多模态智能体落地路径,分享平衡研究与产品的见解,还为年轻人在AI浪潮中发展给出建议,指出底层系统能力是关键。

AI前线
新闻资讯8

Claude Opus 4.7突然发布:逐字级精准执行指令,软件工程和视觉能力大幅领先opus 4.6

Anthropic突然发布Claude Opus 4.7,重点提升软件工程能力,视觉能力也大幅跃升。指令遵循能力实质性提升,记忆能力改善。还同步上线新功能,升级前需关注分词器和token输出变化。

AI寒武纪
算法论文8

快手&中科院 | 提出多模态奖励模型:R1-Reward,比SOTA模型提升5%-15%!

多模态奖励模型对提升多模态大语言模型表现至关重要,但现有强化学习算法用于训练存在问题。快手、中科院等团队提出 R1 - Reward,在基准上比 SOTA 提升 5% - 15%,还在快手业务场景成功应用。

AINLPer
算法论文8

数据邪修大法好:仅用文本数据就能预训练多模态大模型

多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。

量子位