「长视频连贯性」共找到 1520 篇相关文章
Waver:面向统一图像与视频生成的高性能基础模型
字节提出的Waver是面向统一图像与视频生成的高性能基础模型,支持T2V、I2V、T2I。它引入新架构、结合筛选流程与质量模型。虽有局限,但表现出色,架构设计独特,功能多样。
MiniMax 技术闭门会分享:长上下文是 Agent 的 Game Changer
MiniMax 7月10日举办M1技术研讨会,探讨模型架构创新等领域。会议围绕RL能否赋予模型新能力、预训练价值等展开,指出长上下文是Agent的Game changer,混合架构将成主流,还分享了混合架构推理实践及M1相关问答。
拒绝视频生成,深度跃迁提出具身基座模型全新路线
深度跃迁发布世界动作模型 DELE - w0.5,放弃基于视频生成模型的路线,训练时联合学习动作与未来世界表征,推理时移除该表征分支。在真机实验中表现超基线,具跨背景泛化能力,为世界模型提供新思路。
重磅!鸿蒙平台首个全跨端APP ——腾讯视频ovCompose框架发布
腾讯视频团队推出跨平台开发框架ovCompose,弥补Compose Multiplatform不足。还推出KuiklyBase,涵盖多项鸿蒙适配等建设。该框架有高性能、支持混排等优势,已开源,未来将持续优化。
LiveWorld:视频世界模型新范式,让镜头之外的世界继续演化
现有视频世界模型存在“静态世界假设”,物体离开视野后状态不再更新。阿德莱德大学等研究者提出 LiveWorld,将世界演化与观察渲染解耦,使事件在视野外持续推进,并通过实验验证其有效性。
OmniHuman-1.5:让数字人拥有“思考”的视频生成新范式
现有视频数字人模型难捕捉角色本质,字节提出 OmniHuman - 1.5 框架。其核心创新是用 MLLM 提供语义引导、提出多模态 DiT 架构和伪末帧设计,使模型融合多模态信号,生成高质量角色动画。
马斯克再放大招!Grok AI短视频爆火,一夜全网刷屏
今天凌晨,马斯克更新Grok App,Grok Imagine向Grok Heavy用户推出,iOS App的Imagine功能升级。其生成的视频在𝕏上火爆,众多名人盛赞,它速度快,还将让原版Vine回归,对谷歌Veo 3形成挑战。
3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?
7月31日MiniMax H3和字节跳动Seedance 2.5同日发布,3天后H3开源,8月7日Seedance 2.5开放api。模型变强使产品层要做的事更多,视频Agent需解决生产问题,竞争走向模型层之上。
LlamaIndex 深度实战:用《长安的荔枝》学会构建智能问答系统
文章兼顾 RAG 科普与 LlamaIndex 实战。介绍 RAG 原理,用《长安的荔枝》讲解关键步骤和参数。实战部分展示用 LlamaIndex 搭建问答系统,代码量少。优化篇通过实验给出参数调优建议,架构篇剖析内部机制,最后提及 Agent 化拓展功能。
从诡异视频到假论文,AI正把互联网变成巨型「垃圾场」
AI生成的诡异视频在社交平台流行,如比基尼胖女人跳水、食物自相残“食”等,背后是流量逻辑和低成本创作。更严重的是,AI生成的低质量论文渗透到学术领域,危害知识纯粹性和科研公正性。