多模态视觉作品」共找到 1467 篇相关文章

算法论文8

解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换

视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。

机器之心
开源动态7

国内首套:港中文团队发布7模态人体动作数据集,揭开大模型理解能力短板

港中文邢国良教授团队博士生蒋思阳完成 CUHK-X 多模态人体动作数据集,成果被 ACM MobiSys 2026 接收。用其测试主流大模型,发现理解人类动作平均正确率仅四成。该数据集数据收集方法反常规,还开展了基准测试。

DeepTech深科技
产品应用7

打工人五一自救指南:把活全甩给AI,准备免打扰出门

五一将至,为避免假期工作内耗,可安装百度智能云打造的AI助手DuMate。它支持多模态理解与生成,能跨应用完成复杂任务。经测试,它可高效处理整理文件、生成报告等工作,还能并行处理多项任务。

量子位
新闻资讯7

5V5电竞版Prompt Battle来了,这是AIFUT大会最后的总结。

AIFUT大会结束,最后半天有圆桌、演讲与Prompt Battle电竞赛。余轶南谈具身智能和家庭机器人;5v5电竞赛红队夺冠;神思远等探讨影视行业;快刀青衣等交流AI创业;张泓等讨论AI投资;吕思彤分享开发经验。

数字生命卡兹克
开源动态8

AI能帮忙厨房看火了!面壁智能开源全模态模型MiniCPM-o4.5,边看边听还能主动抢答

面壁智能开源全模态模型MiniCPM-o4.5,能边看边听还主动抢答。它引入全双工多模态实时流机制,在多方向达全模态模型领先水平。该模型是端侧原生,将与开发板配套,助力端侧智能硬件开发。

量子位
产品应用7

CES 2026趋势照进现实:算力引擎RK182X重塑千行百业,瑞芯微AI生态大会共建落地生态

CES2026推动AI走向现实应用,瑞芯微RK182X作为AIoT2.0算力引擎,在视觉语言和大语言模型表现卓越,支持Qwen3 - VL系列模型。它在音频体验、多领域赋能出色,瑞芯微还构建产业生态促场景落地。

机器之心
推荐文章8

当顶级视频模型半衰期只有 30 天,fal.ai 为什么收入反而一年增长 60 倍?

在生成式媒体技术发展背景下,fal.ai 作为生成式媒体 infra 公司迅速崛起。它通过统一 API 与云端平台提供多模态模型调用能力,2025 年收入增长 60 倍并完成融资。文章解析其如何构建护城河及对行业发展的判断。

海外独角兽
开源动态8

当LeCun还在「画饼」,中国AI大牛领先李飞飞一步把世界模型开源了

具身智能突破「遥操作」数据桎梏,商汤联合创始人王晓刚领衔的大晓机器人发布全球首个开源商业落地世界模型「开悟3.0」。它是多模态理解 - 生成 - 预测一体化,有强物理感知力,还解决了空间感和时间记忆问题。

新智元
新闻资讯7

Cursor只排第6!136国用户实测25款AI编码工具,第一名73%胜率,还是个新面孔

Design Arena评测平台用对抗式评测方法,让用户对AI模型生成的设计作品投票,评估其设计美学表现。文章总结了上榜的编码工具,如new.website胜率约73%排第一,还对比了不同类型模型的排名情况。

AI进修生
产品应用7

搜索 ≠ 简单匹配!0代码实现语义级图文互搜

在非结构化数据爆发增长的当下,传统图文检索方式难以满足企业需求。本方案介绍借助阿里云 Milvus 实现高效多模态图文检索,覆盖多场景,有开箱即用、性能强等优势,还给出架构、部署、验证及清理资源的方法。

阿里云开发者