生成式视频压缩」共找到 2836 篇相关文章

算法论文8

从“一句成片”到“长轨推演”:探究多模态智能体在长视频编辑中的应用

近年来大语言模型在长篇视觉叙事中潜力卓越,但长视频剪辑仍难控制。中科大等团队开源工作从系统工程视角研究多模态智能体在长视频编辑中的机制,重构剪辑管线,找到症结并给出解决办法。

量子位
开源动态8

不用额外缓存!英伟达开源大模型记忆压缩方案,128K上下文提速2.7倍

英伟达联合多机构推出TTT - E2E方法,在长文本处理上提速显著且性能不打折。它基于标准Transformer,将长文本建模转为「持续学习」任务,核心是上下文压缩,避免额外缓存,代码和论文已开源。

量子位
算法论文8

细节直逼亚毫米级!港科广分层建模突破3D人体生成|CVPR 2025

港科广团队提出MultiGO创新方案,借助分层建模思路突破3D人体生成难题。该方案通过三级几何学习框架提升重建质量,在多个测试集上性能领先,且在多领域有应用优势,研究成果入选CVPR 2025,项目代码将开源。

量子位
算法论文8

ACL 2026 Main | 不只是调用地图API,Spatial-Agent让大模型生成可执行地理分析工作流

大语言模型在空间领域应用广泛,复杂地理分析问题需组织自然语言成可执行流程。Spatial - Agent 加入 GeoFlow Graph 中间层,借用 GIScience 理论,实验显示能提升准确率,不过仍受数据质量等限制。

机器之心
推荐文章7

Codex 跟练全攻略

本文聚焦 Codex 学习,指出知名 AI 视频博主更新慢,而 B 站有全面的「Codex 跟练」专题,含快速安装、基础入门、进阶技巧、场景应用四个专区,不同阶段用户都能找到合适内容,视频跟练更高效。

AGI Hunt
推荐文章7

深度长文解读 “世界模型” :在虚构与真实交接之处凝视未来

本文深入解读“世界模型”,虽无明确定义,但从目的出发分为表征和生成两类。前者含生物大脑、视觉和语言中心预测;后者有基于规则模拟和数据驱动生成。还探讨LLM是否为世界模型,指出各类模型相辅相成。

AI科技评论
开源动态8

快手在 AI 上,渐入佳境

文章介绍快手多模态大模型 Keye-VL 1.5,参数 8B 适合中小企业。它侧重短视频场景,视频理解能力强,能与业务结合,提升推荐等场景效率。还详述其架构、预训练、后训练及训练架构优化等技术细节。

MacTalk
产品应用7

Gemini 3+Nano Banana Pro+3D 生成+手势控制=?藏师傅教你炫酷展示运动成果

作者作为户外运动爱好者,用Nano Banana Pro做户外运动成果展示的图片提示词和海报效果佳,还将图片转3D模型、加手势控制,文章分享制作方法、提示词及工具使用方式。

歸藏的AI工具箱
新闻资讯7

马斯克宣判代码死刑!AI直出二进制,行业教父集体回怼

马斯克在X上称代码正变成下一个汇编,要让AI直接生成二进制,摒弃“源代码”。此言论引发争议,UML之父、《代码整洁之道》作者等教父级人物纷纷回怼,而现实中AI生成代码已成趋势。

新智元
算法论文8

0人工参与实现梯度更新!MIT新框架让AI自动生成微调数据,权重自主升级

MIT提出新强化学习框架SEAL,可让模型生成微调数据和自我更新指令,实现权重更新。无需人工,模型能自动梯度更新。经知识注入和小样本学习实验验证效果,还介绍了其双循环工作机制。

量子位