多模态理解」共找到 1546 篇相关文章

产品应用7

全球首个跨本体、跨视角、多模态物理世界模型,CurrentWorld-0 来了!

Current Robotics 发布跨本体、多模态物理世界模型 CurrentWorld-0,它从真实数据学规律,整合跨本体、多视角和力触预测,可评测机器人,解决动作可控性等问题,让评测成训练数据入口。

机器之心
推荐文章8

手工软件工程师的时代已经结束!一位连续创业CTO的判断

连续创业者、Tessi.ai CTO Ben Greene 在访谈中指出,生成式 AI 改变软件工程形态,手工软件工程师时代过去。工程师应转向理解问题、设计系统,具备系统思维、业务理解和与人协作能力,学会“AI 编排”。

InfoQ
开源动态8

「0污染」LLM理解基准来了!20000道题14个学科全覆盖,来自微软

MMLU-CF是微软亚洲研究院推出的无污染多任务语言理解基准测试,含20000道题、覆盖14学科。通过去污染规则和闭源测试集防数据泄露,保证评估结果可靠,已在Huggingface开放。

新智元
开源动态7

VeRL-Omni:面向扩散和全模态生成模型的通用RL后训练框架

VeRL-Omni是面向多模态生成模型的通用RL后训练框架,覆盖多种架构。它有高效多模态rollout、灵活奖励引擎等特性,支持多种硬件,团队还验证了不同训练方式,后续将扩展模型与算法支持。

机器之心
算法论文8

RAG 2.0 深入解读

文章深入解读RAG 2.0,指出其虽在多行业落地,但面临多模态处理、检索质量等挑战。还介绍架构升级,阐述检索、重排序等关键技术,最后探讨统一多模态大模型、安全等发展方向及挑战。

阿里云开发者
算法论文8

清华朱军团队Nature Machine Intelligence:多模态扩散模型实现心血管信号实时全面监测

清华朱军等团队提出多模态生成框架 UniCardio,在单扩散模型中实现心血管信号去噪、插补与跨模态生成。它采用扩散模型和 Transformer 架构,结合持续学习范式,实验表现优,有望用于多领域。

机器之心
算法论文8

多模态大模型别盲目刷题!诊断-生成-强化闭环,找准盲点 | ICML'26

多模态大模型训练常采用‘题海战术’,存在能力诊断不精准、视觉内容缺乏扩展等问题。北大和山大团队提出DPE框架,通过‘诊断-生成-强化’闭环提升模型能力,实验效果显著,还强调训练应具备诊断能力。

新智元
开源动态8

DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude

DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。

AIGC开放社区
开源动态8

阿里开源PromptEcho:用冻结多模态大模型为文生图训练提供高质量Reward

阿里团队提出PromptEcho方法,无需标注和训练reward模型,仅通过冻结多模态大模型(VLM)的一次前向推理获高质量reward。实验显示其在文生图和电商海报文字渲染任务效果佳,且已开源相关代码等。

机器之心
推荐文章8

Karpathy:很多App就不该出生、人类唯一护城河只剩理解、CPU将沦为配角

在Sequoia Ascent峰会上,AI先驱Andrej Karpathy分享对2026年技术浪潮思考。他认为LLM是新物种,让部分旧软件多余,未来软件接口或为说明文本,还谈及模型能力不均匀性、创业机会、智能体经济及人类价值。

机器之心