视频具身基座模型」共找到 8152 篇相关文章

7

The Batch: 886 | OpenAI 与 Meta 多元化其 AI 产品线

OpenAI和Meta此前专注聊天机器人,如今分别推出新举措。OpenAI推Sora 2、ChatGPT Pulse和Instant Checkout;Meta推出Vibes。新项目利用AI提升用户参与度与收入,探索社交视频领域和大模型与商务融合。

DeeplearningAI
算法论文8

充分激发模态协作,MokA量身打造MLLM微调新范式

当下多模态大模型微调多「照搬」单模态微调策略,忽视模态差异。中国人民大学和上海人工智能实验室团队提出 MokA 方法,兼顾单模态与跨模态建模,在多基座、多场景实验中显著提升性能。

机器之心
产品应用7

AI又来带货了!字节推出DreamActor-H1自动对齐手势和商品

在电商和数字营销领域,现有框架呈现效果不佳。字节推出DreamActor - H1框架,基于扩散变换器,集成Seaweed - 7B模型,能生成高保真人机交互视频,有效果突破但也存在局限。

带你学AI
算法论文8

一张照片,一个3D「你」:计算所等提出HumanLift,实现高保真数字人重建

中国科学院计算技术研究所等机构研究人员提出 HumanLift 技术,基于单张参考图像重建高斯网数字人全身。该技术融合三维视频扩散模型和人脸增强,仅需单张人体图片就能重建高逼真三维数字人。

机器之心
算法论文8

SIGGRAPH Asia 2025|30FPS普通相机恢复200FPS细节,4D重建方案来了

3D视觉领域难题是用普通摄像机将高速世界转为数字化4D时空。受限于成本和带宽,现有方法有局限。本文提出“异步采集 + 视频扩散模型修复”方案,用30 FPS相机恢复100 - 200 FPS动态细节。

机器之心
新闻资讯7

登上热搜!Prompt不再是AI重点,新热点是Context Engineering

最近「上下文工程」很火,Andrej Karpathy 为其打 Call。它和「提示词工程」不同,是构建自动化系统给模型提供输入。文章介绍了其核心要素、实践方法论,还给出了参考的博客和视频

机器之心
新闻资讯7

OpenAI关停Sora!25个月从封神到退场

OpenAI宣布关停Sora,其曾风光无限,从2024年发布技术预览到2025年Sora 2上线火爆,后因国产模型突破、版权危机热度退潮。此举是战略调整,为筹备IPO聚焦商用与代码开发。Sora败退,AI视频进入‘中国时间’。

量子位
新闻资讯7

字节Seedance,正在占领好莱坞

字节Seedance从被好莱坞排斥到被认可,进入创作者圈与工作流,用于拍电影长片。它成本低且有免费福利,吸引独立电影人。在AI视频模型竞赛中逼近美国对手,影视业对AI投入将上涨。

量子位
开源动态8

刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界!

蚂蚁灵波开源的LingBot - Map模型实现无尽流,可看∞帧视频稳定实时3D重建。它打破“既要实时、又要记路、还要省显存”的不可能三角,在多项测试中表现优异,补齐具身智能关键拼图。

量子位
推荐文章7

中美 NeoLab 对话:模型和 Agent 如何实现「持续学习」?

在新加坡 AGI Playground 2026 舞台上,AMI Labs 林敏和 Mind Lab Andrew Chen 深度对谈,探讨 Agent 如何将经验转化为能力、持续学习。两人对持续学习给出不同答案,还讨论记忆、学习等基础问题及解决办法。

Founder Park