视觉世界模型」共找到 8094 篇相关文章

推荐文章8

多模态大语言模型的核心技术架构与训练方法的进化

文章深入剖析多模态大语言模型核心技术架构与训练方法的进化,涵盖建模范式、视觉编码器、语言骨干网络、模态对齐、生成范式及训练方法等方面,介绍其演进路径与代表模型,还提及国内模型创新及开源模型OpenVLA。

AIGC开放社区
算法论文8

VLM 实现 10%的精度提高,13.1倍加速!纽约大学新算法让视觉语言模型更小、更快、更准确

纽约大学研究团队用QSVD新方法让视觉语言模型(VLM)效率飞跃,在普通GPU上实现13.1倍加速。它将Q、K、V矩阵捆绑处理,设计秩分配策略,引入量化方案,经多模型评估,展现出低硬件成本、高精度优势。

AIGC开放社区
开源动态8

清华发布世界模型评测新标尺:直击机器人感知与行动鸿沟

清华大学等机构推出 WorldArena 评测基准,用于测试 EWM 真实能力。它融合感知与功能评估,含十六项视频指标,结合主客观评价生成 EWMScore。测试揭示模型在感知与行动上的差距,转型为实用型模型是行业挑战。

AIGC开放社区
算法论文7

清华-腾讯联手:音频 - 视觉多模态任务统一框架

Crab是人大、清华和腾讯合作论文提出的模型,目标是高效一统多模态场景理解任务。它解决了音频 - 视觉理解模型任务干扰、合作显式化不足等难点,通过构建数据集、设计结构和统一架构实现多任务合作。

CourseAI
推荐文章7

深刻理解Token:大语言模型(LLM)是如何看待这世界

文章指出在大语言模型(LLM)中,Token是处理文本的基本单位。介绍了Token的概念、分词方法、向量化过程,还阐述了分词对模型性能的影响,如导致模型在数学、多语言处理上表现不佳等。

AINLPer
产品应用8

首个实时端侧部署世界模型,20万小时人类视频,BeingBeyond实现「两级跃迁」

4月14日,BeingBeyond发布具身世界模型Being - H0.7,将人类视频规模扩至20万小时,采用隐式推理范式,6项权威评测综合第一。还率先实现端侧实时部署,打通数据闭环,推动模型通用与专家能力跃迁。

AI科技评论
产品应用7

小鹏汽车:没有基座模型,何谈物理AI|甲子光年

3月2日,小鹏汽车宣布第二代VLA正式推送。何小鹏认为,端到端小模型无法让自动驾驶从L2跨越到L4,而第二代VLA开创全新物理模型范式,能直接学习真实物理世界,还在不断迭代提升。

甲子光年
产品应用7

The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者

Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 语言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。

DeeplearningAI
开源动态8

ICCV25 Highlight|格灵深瞳RICE模型狂刷榜单,让AI「看懂」图片的每个细节

格灵深瞳公司灵感团队自研的视觉模型基座RICE(MVT v1.5)刷榜多项视觉任务,在ICCV25获Highlight荣誉。它延续MVT系列理念,提升图片内部视觉特征差异性,在多任务验证中表现优异。

机器之心
新闻资讯8

烧2万亿美元却难用?Gary Marcus狂喷AI赛道不靠谱:推理模型只是“模仿秀”,OpenAI一年后倒闭?

知名AI专家Gary Marcus在访谈中称,世界在神经网络投入巨资,但大语言模型无法实现AGI目标。他指出其推理模型是“模仿秀”,会出现幻觉,还预测OpenAI或被微软收购。

AI前线