空间生成」共找到 2576 篇相关文章

8

李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!

全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。

新智元
开源动态8

告别昂贵人工标注,英伟达全自动视频理解助力小模型逆袭顶级大模型

麻省理工、英伟达等推出FoundationMotion,它是全自动数据生成流水线,能解决运动数据稀缺难题。通过自动标注生成问答数据,让小模型经微调后在运动理解上超越顶尖闭源模型,还介绍了其数据生成、问答设计等环节。

AIGC开放社区
产品应用8

MV导演诞生!上海巨人网络用让AI听懂音乐并掌镜拍摄MV

上海巨人网络AI实验室提出YingVideo - MV框架,结合音乐语义分析、镜头规划与视频生成模型,解决传统音频驱动视频生成难题。它分两步生成视频,以MV导演模块统筹,还解决长视频连贯性等问题,性能优于同类模型。

AIGC开放社区
开源动态8

开源音视频同步SOTA基座:极简的单流架构,2秒出片

AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。

AIGC开放社区
产品应用7

ElevenLabs 发布“视频到音乐”:AI 读懂视频内容,为其创作氛围匹配的 BGM。

ElevenLabs推出“视频到音乐”功能,其“Eleven Music”模型能分析视频上下文、情绪和风格,一键生成匹配的定制背景音乐,还能添加画外音和音效,为创作者提供端到端音视频解决方案。

AI进修生
开源动态7

压缩之外,Visual Tokenizer 也要理解世界?

MiniMax和华中科技大学发布视觉tokenizer新研究VTP,引发业界热议。该研究揭示传统仅以重建为目标的视觉tokenizer缺乏高层语义表示,提出在预训练中引入语义理解,还发现Scaling Law现象,虽有争议但为研究提供新视角。

机器之心
算法论文8

切开Claude大脑,Anthropic称发现了一个类似人类意识的内部空间

Anthropic在Claude模型中发现J空间,其与人类大脑全局工作空间理论相似,承载特殊内容且可干预、参与多步推理等,但模型和人脑有差异,研究也有局限性。

DeepTech深科技
开源动态8

首个长程Doc2Repo训练集!代码Agent不止修bug,开始造仓库

中国人民大学高瓴人工智能学院发布DeNovoSWE数据集,专注长程软件工程任务。它通过特定机制构造高质量数据,为代码智能体长程能力训练提供支持,实验显示能显著提升模型仓库生成能力。

新智元
产品应用7

AI 互动游戏的 GPT 时刻到了!谷歌Genie 3首测!太牛了!

谷歌去年发布世界模型Genie 3,支持实时生成可交互视频内容,因成本高未开放。现美国18岁以上Ultra用户可试玩,其操控延迟低、画面清晰、物理交互真实,还介绍了操作流程等。

歸藏的AI工具箱
算法论文8

50年僵局打破!MIT最新证明:对于算法少量内存胜过大量时间

MIT理论计算机科学家Ryan Williams最新研究建立数学程序,将任意算法转化为占用空间更少的形式,证明少量计算内存比大量计算时间更有价值,打破计算机科学家近50年认知。

机器之心