多模态视频大模型」共找到 8238 篇相关文章

算法论文8

物理AI的「原生」时刻:原力灵机发布具身大模型DM0

主流‘预训练 - 后适配’范式有局限,原力灵机联合阶跃星辰提出具身原生 VLA 模型 DM0。它能统一机器人操作与导航,在 RoboChallenge 测试领先,还介绍了架构、训练方法及未来演进方向。

机器之心
开源动态8

央企牵头!这个AI开源社区要让大模型跑遍「中国芯」

6月30日百度文心大模型4.5系列开源并登陆魔乐社区,该社区发起‘模型推理适配协作计划’,想让大模型跑遍中国芯。其升级工具中心和协作空间,联动产业力量,解决模型在国产芯适配难题,推动生态发展。

机器之心
产品应用7

Code2Video:全新AI教学视频生成框架,助力高质量教学

生成式模型在生成专业教育视频时受限,新加坡国立大学Show Lab提出Code2Video框架,以代码为中心,由三个协作智能体组成,能通过Python代码自动生成高质量教育视频,代码驱动生成优势明显。

带你学AI
算法论文8

谢赛宁、李飞飞、LeCun联手提出多模态LLM新范式,「空间超感知」登场

纽约大学助理教授谢赛宁与李飞飞、Yann LeCun 合作提出「Cambrian - S」,迈出视频空间超感知探索第一步。该研究引入 VSI - Super 基准,还提出预测性感知范式,在空间认知任务上有提升,相关论文值得视频多模态研究者参考。

机器之心
产品应用8

杭州跑出的AI独角兽,突围大模型的“第二战场” | 甲子光年

2025年AI行业有转变,算力堆叠对大语言模型性能提升放缓,空间智能成“第二战场”。谷歌、英伟达等巨头纷纷布局,群核科技作为杭州“变量”,发布业界首个3D室内空间大模型,构建数据飞轮,技术有望落地多领域。

甲子光年
开源动态8

谷歌让机器人「长脑子」了!首发离线具身VLA模型,断网精准操控

谷歌首发具身智离线模型Gemini Robotics On-Device,实现VLA多模态模型在具身机器人本地离线运行,无网络也能稳定运行。谷歌还开源了SDK,具身智能迈向实用化新阶段。

新智元
开源动态8

字节跳动&清华大学开源多模态时序大模型ChatTS,可实现时序数据对话与推理

字节跳动与清华合作开源多模态时序大模型ChatTS,可实现时序数据对话与推理。它用合成数据训练,解决了数据稀缺等问题,在评估中表现远超基线模型,未来可拓展至更高阶任务。

机器之心
推荐文章7

LLM不是所有!这几个模型你需要知道!

AI时代不止大语言模型,复合AI系统成共识。掌握各类模型特点对构建高质量AI应用关键,文章介绍了LLM、LCM、LAM等多种模型

AI工程化
新闻资讯7

太卷了!专属Coding的新一代Arena榜单来了,有国产模型登上榜首

模型编程竞争激烈,编码能力提升成军备竞赛。LMArena发布新世代大模型编码评估系统Code Arena,国产模型智谱GLM - 4.6登上榜首,其编码能力获认可,彰显国产大模型硬核实力。

机器之心
开源动态8

无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab

多图像、长视频让大型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。

量子位