多模态视觉理解模型」共找到 1935 篇相关文章

算法论文8

解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换

视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。

机器之心
新闻资讯7

伏曦量子完成天使及天使+轮融资,五源资本、启盈同创等跟投

近日,伏曦量子宣布完成天使及天使+轮融资,由全球动力电池行业龙头领投,多家机构跟投。该公司由赵琦博士创立,定位是帮助产业客户理解和使用量子算力,其核心价值是优化算法,让问题可在近期硬件测试。

DeepTech深科技
产品应用7

我用 GLM-5.2 读 148 万字资料:一天读懂一个知识

作者用 GLM-5.2 处理 148 万字 Transformer 资料,它生成可打开的 HTML 阅读页,将内容排成理解路线。GLM-5.2 在评测榜单中进入第一梯队,主打 1M 上下文,还分享了使用该模型处理资料的具体做法。

AI产品自由
算法论文8

挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2

南京大学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨大鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。

机器之心
新闻资讯7

Meta 143亿挖角后首个作品来了:Alexandr Wang 推出闭源模型,杨立坤点赞

沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,Meta还披露技术实现细节。不过闭源引争议,且模型在长时程智能体等方面有短板。

AI前线
开源动态8

AI能帮忙厨房看火了!面壁智能开源全模态模型MiniCPM-o4.5,边看边听还能主动抢答

面壁智能开源全模态模型MiniCPM-o4.5,能边看边听还主动抢答。它引入全双工多模态实时流机制,在多方向达全模态模型领先水平。该模型是端侧原生,将与开发板配套,助力端侧智能硬件开发。

量子位
产品应用7

CES 2026趋势照进现实:算力引擎RK182X重塑千行百业,瑞芯微AI生态大会共建落地生态

CES2026推动AI走向现实应用,瑞芯微RK182X作为AIoT2.0算力引擎,在视觉语言和大语言模型表现卓越,支持Qwen3 - VL系列模型。它在音频体验、多领域赋能出色,瑞芯微还构建产业生态促场景落地。

机器之心
推荐文章8

当顶级视频模型半衰期只有 30 天,fal.ai 为什么收入反而一年增长 60 倍?

在生成式媒体技术发展背景下,fal.ai 作为生成式媒体 infra 公司迅速崛起。它通过统一 API 与云端平台提供多模态模型调用能力,2025 年收入增长 60 倍并完成融资。文章解析其如何构建护城河及对行业发展的判断。

海外独角兽
新闻资讯7

对谈 Skyris 张宇诺:AI 陪伴机器人会飞,理所应当 | 00 后创业者系列

这是对 00 后创业者张宇诺的访谈,他介绍了 Skyris 会飞陪伴机器人的设计灵感、特点及优势,还谈及创业经历、对陪伴的理解,以及产品研发难题、规划等,最后提到 GAIR 2025 大会将邀 00 后 AI 创业者分享。

AI科技评论
新闻资讯7

18岁天才少年,登上Nature封面!

DeepSeek-R1荣登Nature封面,成史上首个经严格同行评议大模型。18岁天才少年涂津豪以实习生身份参与,其从高中生到Nature作者的经历堪称传奇。他还改造Claude 3.5,开源项目获15k多星,还对AGI发表思考。

新智元