多视角数据」共找到 6010 篇相关文章

开源动态8

开源即爆火!英伟达重磅推出OmniVinci全模态大模型

英伟达在华盛顿GTC大会开源OmniVinci全模态大语言模型,实现视觉、音频、语言统一理解。它性能超竞品,架构有创新,数据引擎庞大。实验有重要洞察,在场景表现佳,代表全新AI范式。

机器之心
新闻资讯8

李飞飞首个模态世界模型 Atlas 正式发布:从零开始预训练,几张图就能构建世界

李飞飞创办的 World Labs 发布模态世界模型 Atlas,可原生处理类型数据,有世界生成、重建和模拟等能力。还介绍其研发历程、技术特点,以及 World Labs 收购、融资等情况。

InfoQ
开源动态8

突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度

模态大语言模型应用元的当下,对模型理解人类意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在基准数据集成果突破性领先。

量子位
新闻资讯8

具身智能「全明星日」来袭!智源组局30+行业掌门人,激辩机器人终极命题

2025年是具身智能「爆发之年」。智源具身2025 OpenDay上,30位行业大佬激辩,议题包括具身架构、数据获取、硬件瓶颈、应用落地等,智源还开源项成果助力行业发展。

新智元
开源动态8

Identity-GRPO:阿里开源人物定制化视频生成的后训练优化算法

阿里团队提出Identity - GRPO算法解决人物视频生成身份一致性问题。构建约15000个标注样本数据集,基于Qwen2.5VL设计奖励模型,项策略增强训练稳定性,实验验证性能提升显著。

PaperAgent
新闻资讯7

DeepSeek“极你太美”bug,官方回应了

DeepSeek V3.1调用API开发时输出常现“极”字,在火山引擎、腾讯CodeBuddy等平台出现,影响代码编译。官方称将在近版本修复,网友猜测或因数据清洗不彻底。

量子位
算法论文8

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

AI视频生成技术发展快,现有检测方法难满足需求。新综述提出‘事实保真度验证’目标,梳理四层检测框架,涵盖底层线索、时空一致性等,强调层证据耦合与可解释性,还分析评测指标与数据集。

新智元
开源动态8

冲159K星 OpenClaw工具链,正在悄悄改变Agent玩法

Clawdbot更名openclaw后在github星冲到159K。它能让AI深入工作流且保数据隐私,有集成渠道、工具齐全、有状态会话与持久记忆、路由策略适配不同模型等核心能力,并在方面优于常见AI工具。

CourseAI
产品应用8

AI无限生成《我的世界》,玩家动动键盘鼠标自主控制!国产交互式世界模型来了

昆仑万维带来交互式世界模型Matrix - Game,可让用户用键鼠探索创作虚拟内容。它发布了Matrix - Game - MC数据集、主模型和GameWorld Score评测体系,在项评测中领先,还能在领域发挥作用。

量子位
开源动态8

重新定义检索!一款真正“跨模态”的 RAG 模型来了!用音频搜视频、文本找音乐!

传统RAG有速度慢、细节丢失等问题。Vidore开源的ColQwen - Omni 3B模态RAG模型,支持跨模态检索,能直接处理音视频原始数据,保留细节,检索速度快,还具备轻量高效等特性,适用于场景。

开源星探