深度多模态整合」共找到 1875 篇相关文章

产品应用7

阿里首个世界模型:快乐…生蚝

刚成立一个月的阿里ATH事业群发布全球首个主动式实时交互世界模型HappyOyster(快乐生蚝),它搭载原生多模态架构,有漫游、导演、创造、分享等玩法,目前需邀请码体验。其技术突破让它区别于传统文生视频模型。

量子位
新闻资讯8

“大鱼吃小鱼”:一文看懂2025年度国内半导体收购

2025年国内半导体领域并购交易超50起创新高,但成功率降至近三年最低。本文盘点多起并购案例,如中芯国际收购中芯北方、华虹半导体收购华力微等,涉及晶圆制造、IP/EDA、设备材料、芯片设计等领域,展现产业整合趋势。

芯师爷
新闻资讯7

半佛怕爆款,三表拒AI,冰汝谢川普

在短视频和 AI 席卷内容行业的当下,今日头条 2025 年深度创作者大会上,驻美记者王冰汝、财经博主半佛仙人、自媒体人三表龙门阵分享了各自的焦虑与坚守。他们谈到爆款、AI 影响、创作模式等问题,展现不同生存哲学。

乱翻书
新闻资讯8

英伟达4B小模型击败GPT-5 Pro!成本仅1/36

英伟达ARC - AGI 2中,4B小模型NVARC以27.64%成绩力压GPT - 5 Pro登顶,单任务成本仅其1/36。亮点是零预训练深度学习法,还靠合成数据、测试时微调等策略。小模型特定领域优化后优势明显。

量子位
开源动态8

开源Agent模型榜第一名,现在是阿里通义DeepResearch

阿里开源首个深度研究Agent模型通义DeepResearch,在多权威评测集上超越多个Agent模型。它采用多阶段数据策略,有两种推理模式,革新训练流程,已赋能高德出行Agent和通义法睿等应用,且模型等均已开源。

量子位
算法论文7

视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K

视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。

带你学AI
开源动态8

英伟达&MIT等推出Long-RL,长视频训练速度翻倍

英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。

机器之心
开源动态8

这个新生图模型有点夯:4K直出的,国产的,开源的!

商汤新开源的生图模型SenseNova U1.5-Lite-Preview亮点十足,它是国产、4K直出、轻量且可指哪儿改哪儿的原生统一多模态模型。能应对复杂创作和编辑任务,技术源于NEO-Unify架构,评测成绩佳,不过还是早期预览版。

量子位
产品应用7

6个电子牛马替我上班,腾讯马维斯好用吗?

5月20日腾讯上线AI助手马维斯,由六个AI Agent组成。经测试,它在定时任务、搜索整理、竞品分析等场景有表现,但也存在文件操作易出错、图片识别不稳定、分析深度不足等问题。其背靠腾讯生态有渠道优势,但需提升体验促使用户留存。

芯师爷
开源动态8

准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用

近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。

量子位