生成式视频压缩」共找到 2836 篇相关文章

产品应用8

华为世界模型来了!单卡30分钟生成272㎡场景

华为联合上海交通大学、华中科技大学推出世界模型WordGrow,可生成1800㎡超大室内场景,单卡30分钟跑272㎡。它用数据精准预处理、3D块补全机制、粗到精生成策略填3D场景构建的坑,指标优、速度快。

量子位
产品应用7

Kimi K2:唯一能稳定准确生成时钟的AI模型

AI World Clocks项目让9个大模型按提示词生成每分钟更新的时钟,以观察稳定性。国产Kimi K2是唯一能稳定保持表盘与指针正确平滑转动的模型,测试显示了模型在时空概念上的能力差异。

AI工程化
算法论文8

高保真、多控制集成于「统一画布」,组合式图像生成新范式!

Canvas - to - Image是新型图像生成框架,将多种控制方式整合到统一画布,用户可直观操作生成高保真、多控制图像。它简化创作流程,解决了现有方法控制单一分散、交互性差的问题。

新智元
新闻资讯7

「AI生成的内容全部加水印」OpenAI、Anthropic、Google都签了

OpenAI、Anthropic、Google等公司签署欧盟《AI生成内容透明度行为准则》,承诺推进AI生成内容标记与检测。Claude已公布落实方案,文本水印早有先例,但「水印」可信度遭质疑。

机器之心
算法论文7

SceneGen: 单图像驱动的多资产3D 场景生成

上海交通大学提出SceneGen框架,可从单张场景图像及其对应目标掩码中,同时生成带有几何结构与纹理的多个3D资产。它一次前向传播即可完成生成,在效率与稳健性上优于现有方法,虽有局限但应用潜力大。

带你学AI
算法论文8

推理速度飙升5倍,苹果提出全新Multi-Token生成框架!

自回归语言模型逐词生成文本拖慢推理速度、限制并行能力。Apple提出全新框架,挖掘其对未来词元“先验知识”,通过多项技术并行预测多词元,微调预训练模型可显著提速且不损输出质量。

PaperAgent
算法论文7

全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%

MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。

量子位
开源动态7

多模态需求井喷,智能视频云如何靠分布式处理破局?

国内多模态AI发展中,模型层火热但应用层落地慢。多模态应用落地面临体验升级、视频化扩展、大模型部署下沉挑战,催生智能视频云升级需求。火山引擎在FORCE大会展示分布式多媒体处理实践,推出MIPP平台,未来将开源并推商业化产品。

InfoQ
产品应用8

超越Runway!Adobe发布新神器:P视频比P图还简单

Adobe联合多高校推出AI模型EditVerse,它将图片和视频编辑整合,解决传统视频编辑复杂、数据稀缺问题。通过通用视觉语言、上下文学习能力和知识迁移,其效果超Runway,还展现涌现能力。

新智元
开源动态7

HeyGen开源HyperFrames框架:Remotion劲敌,用HTML写视频的时代来了

HeyGen开源HyperFrames框架,解决视频制作专业工具学习成本高、简单工具缺灵活性的矛盾。它基于HTML,与Remotion设计哲学不同,渲染快、输出体积轻,有诸多特性和应用场景,安装简单。

AI工程化