「视频动捕」共找到 1105 篇相关文章
机器人终于「懂」家务了!伯克利MomaGraph让机器人像人一样做家务
过去家用机器人做家务存在诸多难题,最近加州伯克利和马里兰大学联手推出 MomaGraph 技术。该技术采用「Graph - then - Plan」思路,团队搭建了完整体系,在星动 Q5 上测试效果好,让家用服务机器人迈向实用。
Meta 系 95 后华人明星团队,创业一年就与高通达成合作,让手机拥有多模态记忆
由华人创业者沈俊潇创办的 Memories.ai 发布 LVMM 2.0 并宣布与高通合作,该模型 2026 年将在高通处理器上原生运行。它解决视频可搜索性问题,应用广泛,能降低延迟、确保数据安全等。
世界模型有了开源基座Emu3.5!拿下多模态SOTA,性能超越Nano Banana
北京智源人工智能研究院的悟界·Emu3.5是最新最强的开源原生多模态世界模型,能处理图、文、视频任务,在多项权威基准上性能亮眼,还具备理解长时序等能力,背后有技术创新,且选择开源。
WaveSpeedAI 成泽毅:AI Infra 本来就是一门能挣钱的生意
WaveSpeedAI成泽毅本在大厂做Infra,后创业。他先在社区验证技术价值,创业首日就定全球化策略。WaveSpeedAI团队小而灵活,用利他思维合作,在视频生成领域降成本,验证了推理基建有市场。
Artificial Analysis 发布 2025 年 AI 现状 Q3 季报
Artificial Analysis发布2025年Q3 AI现状报告,揭示五大关键趋势,如推理模型占智能榜单前十、智能体能力突破、开源模型发布创新高、图像视频技术主流化、原生语音模型达生产级,还将举办简报会。
无需多视角,单图重建可交互3D模型!南洋理工开源结构推理框架
南洋理工大学团队提出MonoArt,将单目可动物体重建建模为渐进式结构推理过程,通过四个关键模块逐步推理,无需外部先验,在PartNet - Mobility基准测试中表现领先,兼顾推理效率,还可用于下游任务。
再也不怕面瘫脸!YouTube黑科技:AI帮你「永久微笑」,连僵尸都咧嘴笑
YouTube在Shorts相机里实现AI实时「重绘」人脸,效果自然。它通过知识蒸馏将大模型「瘦身」成小模型,用迭代蒸馏打磨细节,PTI保证身份特征,MediaPipe搭建推理管道,还将拓展视频生成功能。
抖音+Claude Code=?马斯克都要转发的产品!一句话,就能做一个中国风福尔摩斯游戏!
Loopit被称为‘AI编程版的抖音’,用户说句话就能做互动内容,如解谜游戏等。它让编程像拍视频一样成消费品,有创作和社区,结合抖音轻量与游戏互动感,粘性更高。
开源黑科技!向量数据库,居然要被 MP4 给干掉了!
GitHub开源项目Memvid,能用MP4视频文件替代昂贵的向量数据库,检索达亚秒级。它把文本编码成视频,用配套JSON索引记录位置,结合sentence-transformers和FAISS实现语义搜索,存储和检索性能出色。
倒反天罡!Claude「反向」操控人类,公司估值冲2万亿跃居全球第二
2026年1月17日,一段‘AI指挥人类写代码’视频刷屏,Claude Code能力引发关注,模糊人机交互界限。18日《金融时报》称红杉资本将参与Anthropic新一轮融资,其估值冲向3500亿美元,或成2万亿级AI独角兽。