生成式视频压缩」共找到 2836 篇相关文章

产品应用8

创业一年后,李飞飞推出首款可商用世界模型 Marble,任意模态都可生成 3D 世界

李飞飞创业公司 World Labs 推出可商用世界模型 Marble,支持多模态输入,生成的 3D 世界更丰富细致。李飞飞认为空间智能是 AI 下一个前沿,当前 AI 在这方面能力不足,而 Marble 正推动其发展。

Founder Park
开源动态7

4.5k星星爆火!用图片压缩Fable 5上下文,成本大幅降低,终于用得起这个模型了

Fable 5在AI圈爆火,但使用成本比其他型号贵至少5倍。pxpipe项目把适合压缩的大段文本渲染成PNG图片,交给多模态模型读取,能大幅降低成本,还能增加上下文长度。

开源AI项目落地
推荐文章7

抖音、视频号、小红书、公众号、百家号、网站、DeepSeek AI等SEO排名关键词布局怎么做?【收藏】

白杨SEO分享多平台SEO排名关键词布局方法。先讲核心步骤,包括确定主题、做话题树、定优先级和内容类型,后详细介绍抖音、视频号等7个平台的关键词布局具体做法。

白杨SEO优化教程
算法论文8

公里级场景也能稳住了,国产团队把长视频3D重建又往前推了一步

浙江大学、地平线机器人和之江实验室的新工作 Scal3R 要解决长视频 3D 重建问题。它借助 test - time training 技术,设计全局上下文模块和同步机制,提升长序列重建稳定性和精度,能处理超万帧几千米的场景。

机器之心
产品应用8

编码封神,Gemini 2.5 Pro (I/O 版)视频秒转 App!网友:比 o3/Claude 强,Vibe 程序员集结!

谷歌 I/O 大会前,Gemini 2.5 Pro 预览版升级,重点在编码。它搞前端、做 UI 出色,能将视频变互动学习 App,推理速度提升。对标 GPT - 4.1 等,性价比高、表现优,获开发者好评。

AI进修生
算法论文8

BIGAI & 中科大团队提出 MILR: 测试时隐空间推理,让图像生成学会「边想边改」丨ICLR 2026

BIGAI与中科大等团队提出MILR,通过测试时隐空间推理,在不更新模型参数下优化图文表示,提升复杂图像生成能力。该方法在多基准测试达SOTA,还探讨了测试时扩展与奖励模型,未来有诸多拓展方向。

AI科技评论
开源动态8

让AI打游戏!能玩1000多款游戏,英伟达用4万小时视频训练出通用基础模型NitroGen

NVIDIA发布NitroGen模型,利用40000小时带按键显示的游戏视频,构建视觉-动作数据集,训练出能玩超1000款游戏的通用基础模型,在跨游戏泛化和微调任务中表现卓越,为具身智能发展提供新思路。

AIGC开放社区
产品应用7

当Sora2遇上国产 Vidu Q2,国产参考生真的更香了!一手亲测

国庆假期Sora 2吸睛,其客串功能将它拉到“AI版抖音”高度。但Vidu去年9月就提出【参考生】视频功能,Vidu Q2已是第5个迭代版本。文章对Vidu Q2参考生视频和Sora 2从一致性、物理规律遵循、运镜等维度进行PK。

量子位
算法论文8

AI 会笑吗?BIGAI & 上交大团队:多模态大模型是否真的能 get 到视频笑点|ACL 2026

上海交通大学等团队构建v-HUB评测基准,分析多模态大模型视频幽默理解能力。评测7个前沿模型发现,模型依赖文字、主动发现笑点能力弱,声音作用有限,还需考虑隐形线索。

AI科技评论
开源动态8

Soul App 又又又开源了!这次是实时交互数字人,支持小时级长视频甚至无限时长!

Soul App 新开源实时数字人项目 SoulX-LiveAct,解决 AR 扩散模型流式生成稳定性问题。它实现 20 FPS 实时流式推理,延迟 0.94 秒,支持无限时长,有恒定显存等亮点,可用于多场景。

开源星探