「实时视频生成」共找到 2866 篇相关文章
开源2天狂揽3.3K Star!超火的隐形AI桌面助手,实时捕捉屏幕与音频,生成结构化知识!
GitHub爆火的隐形AI桌面助手Glass,开源2天Star超3.3K。它由Pickle团队开发,能捕捉屏幕和音频活动,转化为结构化信息。适合会议记录等场景,有屏幕活动捕捉等核心能力,提供不同系统安装方式。
拍我AI V5模型发布,AI视频的“不可能三角”被解开了?
拍我AI推出V5模型,一上架就到Artificial Analysis榜单前列。它在多维度升级,维持速度和性价比优势,试图解开AI视频生成“不可能三角”。文章实测其运动、二次元、商业等场景表现,还提及速度与价格优势。
提示词一响,烂片登场,OpenAI谈下200+迪士尼顶级IP出场费
迪士尼官宣向OpenAI投资10亿美元,签三年合作协议,授权Sora用旗下200多个顶级IP生成短视频。此前好莱坞与AI版权纷争不断,如今迪士尼选择变现,但生成内容或影响其品牌形象。
登顶全球权威榜单!浙大创业团队百卡打造开源实时世界模型,视频秒变可交互4D世界
全球科技界正豪赌「世界模型」,但主流模型多停留在「视觉生成」。中国影溯公司发布并开源世界模型 InSpatio - World,综合性能优异,以小博大登顶权威榜单,降低了物理世界数字化门槛,引发行业关注。
真实场景也能批量造「险」!VLM+扩散模型打造真实域自动驾驶极限测试
浙江大学与哈工大(深圳)联合推出SafeMVDrive,将VLM关键车辆选择器与两阶段轨迹生成结合,可在真实域批量制造高保真安全关键视频,用于端到端自动驾驶系统安全性测试。
谷歌“世界模拟器”深夜上线!一句话生成3D世界,支持分钟级超长记忆
谷歌DeepMind发布新一代通用世界模型Genie 3,只需一句话就能生成可实时交互的3D世界。性能大幅升级,支持720P画质等,还能推动具身智能体研究,谷歌期待其助力迈向AGI。
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。
CVPR 2026 | 给扩散模型装上「物理引擎」: 北大彭宇新团队提出NS-Diff,使扩散模型学会流体与刚体力学
北大彭宇新团队提出 NS - Diff,将物理约束与强化学习结合,解决视频生成物理失真问题。它通过多模块提升视频物理真实感,实验表明在多数据集上超现有方法,降低物理运动误差。
Google 亲手证明:GUI 已死,但尸体还在动
Google DeepMind发布Flash - Lite Browser,能用Gemini 3.1 Flash - Lite实时生成网站。它表明GUI连预先设计都不需要,界面正发生三层分化,虽有不足,但展现界面从预制到即时生成的趋势。
UofT、UBC、MIT和复旦等联合发布:扩散模型驱动的异常检测与生成全面综述
多伦多大学、麻省理工学院等高校研究者合作完成长文综述,聚焦扩散模型在异常检测与生成领域的应用,梳理图像、视频等异常检测任务进展,提供分类体系,展望未来趋势。