多模态技术」共找到 3549 篇相关文章

8

李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!

全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。

新智元
新闻资讯7

英伟达亲手终结CUDA「护城河」?传奇芯片架构师引发争议

英伟达CUDA宣布20年来最重大更新,引入CUDA Tile技术,降低开发门槛。芯片界传奇人物Jim Keller质疑此次更新是否终结CUDA「护城河」,文章分析了相关问题,指出瓦片架构对英伟达内外移植性的不同影响。

新智元
新闻资讯7

优理奇机器人完成两轮合计3亿元天使++++轮及天使+++++轮融资,“算法-硬件-场景”三位一体加速具身智能应用落地

优理奇机器人近日完成两轮合计3亿元融资,是半年内第五轮。其坚持“场景驱动”,产品在运动会获奖,量产交付订单超千台。构建完整技术栈,推出标准化机械臂产品,创始人看好具身智能统一发展。

量子位
开源动态8

没想到,音频大模型开源最彻底的,居然是小红书

近几个月,开源成AI社区焦点,国内厂商七八月开源多款大模型,但音频生成占比小。小红书技术团队自去年起在音频领域稳定开源,成果覆盖TTS、ASR方向,具商用属性,降低落地门槛。

机器之心
产品应用8

快手发布Keye-VL-1.5,同量级SoTA,让模型真正看懂视频!

近年来,多模态大语言模型兴起,但视频理解仍是难题。快手Keye团队推出Keye-VL-1.5,通过Slow-Fast编码策略、渐进式四阶段预训练和全面后训练流程等创新,实现视频理解突破,综合性能领先。

深度学习自然语言处理
推荐文章8

对话RoboScience邵林:VLOA大模型如何突破具身智能泛化瓶颈

本文对话RoboScience联合创始人邵林,探讨VLOA大模型突破具身智能泛化瓶颈。他介绍了模型优势、设计思路,对比VLA,还谈及范式、难点及落地场景等,强调以人中心、做有温度技术,重视模型落地。

甲子光年
开源动态8

AI不靠“闭门造神”,海内外一线专家共探智能新纪元,GOSIM AI Paris 2025圆满收官!

5月7日,GOSIM AI Paris 2025在法国巴黎迎来第二日议程。全球专家围绕AI技术多方面探讨,涉及模型、基础设施等主题。还分享大模型趋势,宣布新型许可证,各分论坛展示多元成果,大会圆满收官,杭州场9月待启。

AI科技大本营
新闻资讯7

字节Seedance 2.0发论文了,171人署名,吴永辉曾妍在列

现象级AI视频技术字节Seedance 2.0在arXiv发论文,公布26页Benchmark和170位贡献者名单。此时它正通过Byteplus平台铺向全球,支持多模态输入。该模型突破瓶颈,评测表现优异,团队近半换血。

量子位
新闻资讯8

CES 2026超前瞻:空间智能来势汹汹!从实验室奢侈品到消费级刚需,如何重塑 AI 具身时代?

2026年CES展上,空间智能从学术概念迈向产业实践。当前具身智能存在‘语言强、手脚笨’困境,空间智能是破解关键。全球分世界生成与空间决策两条技术路径,且行业正迎来成本降低的拐点。

机器之心
算法论文8

AST | 西交大刘子扬、陈刚等:直接嵌入流场特征的智能化气动外形优化经验学习框架

传统气动外形优化方法有局限,本文提出智能化优化经验学习框架,结合DNN流场预测模型与DRL优化方法,还提出自适应网格再生成技术与Sigmoid奖赏函数,经验证效果良好,为气动优化提供新路径。

力学与人工智能