「音视频一体化」共找到 1042 篇相关文章
任意骨骼系统的模型都能驱动?AnimaX提出基于世界模型的3D动画生成新范式
传统3D动画制作依赖骨骼绑定与关键帧编辑,成本高。现有自动化方法有局限。北京航空航天大学团队提出AnimaX框架,结合视频扩散模型与骨骼动画优势,支持任意骨骼拓扑,生成动画质量高、速度快,泛化能力强。
大模型全面爆发,所有榜一都是Gemini!谷歌一夜站到了台前
北京时间今日凌晨,Google I/O 2025 开发者大会开启。谷歌发布或升级系列 AI 工具与服务,如升级 Gemini 模型、推出编程智能体 Jules 等,还展示视频图像生成模型、搜索与购物模式升级,展现其在 AI 应用领域强势回归。
MMX-CLI给AI Agent装上七种感官,内容创作更方便
MiniMax发布的MMX - CLI命令行工具,给AI Agent装上七种新感官,具备图像生成、视频创作等能力,可一站式解决内容创作问题。它安装使用简单,功能多,还能集成到现有工作流,不过采用按量付费。
Meta 系 95 后华人明星团队,创业一年就与高通达成合作,让手机拥有多模态记忆
由华人创业者沈俊潇创办的 Memories.ai 发布 LVMM 2.0 并宣布与高通合作,该模型 2026 年将在高通处理器上原生运行。它解决视频可搜索性问题,应用广泛,能降低延迟、确保数据安全等。
世界模型有了开源基座Emu3.5!拿下多模态SOTA,性能超越Nano Banana
北京智源人工智能研究院的悟界·Emu3.5是最新最强的开源原生多模态世界模型,能处理图、文、视频任务,在多项权威基准上性能亮眼,还具备理解长时序等能力,背后有技术创新,且选择开源。
WaveSpeedAI 成泽毅:AI Infra 本来就是一门能挣钱的生意
WaveSpeedAI成泽毅本在大厂做Infra,后创业。他先在社区验证技术价值,创业首日就定全球化策略。WaveSpeedAI团队小而灵活,用利他思维合作,在视频生成领域降成本,验证了推理基建有市场。
Artificial Analysis 发布 2025 年 AI 现状 Q3 季报
Artificial Analysis发布2025年Q3 AI现状报告,揭示五大关键趋势,如推理模型占智能榜单前十、智能体能力突破、开源模型发布创新高、图像视频技术主流化、原生语音模型达生产级,还将举办简报会。
再也不怕面瘫脸!YouTube黑科技:AI帮你「永久微笑」,连僵尸都咧嘴笑
YouTube在Shorts相机里实现AI实时「重绘」人脸,效果自然。它通过知识蒸馏将大模型「瘦身」成小模型,用迭代蒸馏打磨细节,PTI保证身份特征,MediaPipe搭建推理管道,还将拓展视频生成功能。
抖音+Claude Code=?马斯克都要转发的产品!一句话,就能做一个中国风福尔摩斯游戏!
Loopit被称为‘AI编程版的抖音’,用户说句话就能做互动内容,如解谜游戏等。它让编程像拍视频一样成消费品,有创作和社区,结合抖音轻量与游戏互动感,粘性更高。
开源黑科技!向量数据库,居然要被 MP4 给干掉了!
GitHub开源项目Memvid,能用MP4视频文件替代昂贵的向量数据库,检索达亚秒级。它把文本编码成视频,用配套JSON索引记录位置,结合sentence-transformers和FAISS实现语义搜索,存储和检索性能出色。