音视频解决方案」共找到 1089 篇相关文章

新闻资讯7

AI狂飙100天,中国力量突起!顶流视频号10分钟看尽全球最强杀招

2025年开年,全球AI版图重绘,从中国DeepSeek开源风暴到OpenAI闭源反击,双方在算力、模型等层面激烈碰撞。各月双方均有新动作,4月AI迈入全民普及,新智元联合视频号推出活动助掌握科技风向。

新智元
开源动态8

视频世界模型困在像素网格里:腾讯开源SCoPE,用射线空间重写位置关系

香港大学、香港科大与腾讯ARC Lab联合提出SCoPE,让视频模型处理位置关系的基底从张量网格转向射线空间。它将相机射线坐标注入Video DiT,新增参数不到原模型0.1%,多方面表现获改善。

机器之心
产品应用7

谷歌AI试穿神器真神了!上传照片秒出OOTD,视频效果和照镜子没区别

谷歌推出应用Doppl,上传照片就能看到衣服“穿”在自己身上的效果,还能生成动态视频。它不仅能试穿,还会帮忙搭配。此外,Google Labs还有Portraits、文生视频产品Flow等小实验。

量子位
开源动态8

阿里再开源,全球首个MoE视频生成模型登场,电影级美学效果一触即达

继上周开源三连发后,阿里昨晚开源全球首个 MoE 架构视频生成模型 Wan2.2,具电影级美学控制能力。它有 MoE 架构创新等四大技术亮点,可在 Hugging Face 和阿里魔搭社区下载。

机器之心
算法论文8

首次实现第一视角视频与人体动作同步生成!新框架攻克视角-动作对齐两大技术壁垒

新加坡国立大学等联合发布EgoTwin框架,首次实现第一视角视频与人体动作联合生成,攻克视角-动作对齐与因果耦合瓶颈。它基于扩散模型,通过三大创新设计解决难题,实验性能超基线。

量子位
开源动态8

北大字节开源首个时空推理视频模型!思考过程全透明,性能超越GPT-4o

北大和字节联合团队推出开源模型Open-o3 Video,将显式时空证据嵌入视频推理全过程,采用non-agent架构,性能超越GPT - 4o等闭源模型。该模型构建了STGR语料体系,采用双阶段训练,实验表现优秀。

量子位
产品应用8

重构终端智能算力边界丨隼瞻科技在RISC-V中国峰会首发“智翼”端侧AI融合解决方案

人工智能时代,设备端侧面临多重挑战,传统方案渐显乏力。隼瞻科技在第五届RISC-V中国峰会推出“智翼”系列端侧AI融合处理器解决方案,以先进架构和多元优势,为行业破局提供新思路。

芯师爷
开源动态8

颠覆传统向量数据库,直接将文本数据编码成视频文件,轻量级革命性的大规模AI记忆解决方案Memvid

Memvid将文本数据编码为视频,改变AI记忆管理,实现百万级文本块闪电语义搜索和亚秒级检索。它存储高效、轻量级、可离线,应用场景广,还给出安装、使用、配置等说明,并与传统方案对比。

GitHubStore
算法论文8

亿级短视频数据突破具身智能Scaling Law!Being-H0提出VLA训练新范式

真机数据匮乏使具身智能VLA模型发展受限,现有真机数据与所需上亿级训练样本相差甚远。BeingBeyond团队提出创新性方案,利用人类视频手部数据构建数据集,训练出VLA模型Being - H0,经实验验证效果良好。

量子位
开源动态8

美团杀入视频生成模型赛道,LongCat-Video 136亿参数媲美顶尖模型,效率提升10倍

美团LongCat团队发布LongCat - Video基础视频生成模型,有136亿参数量,多任务表现出色。它核心亮点多,还建立了数据处理流水线,采用特殊架构和训练方法,提升了生成效率,性能媲美顶尖模型。

AIGC开放社区