「视频生产」共找到 1233 篇相关文章
DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理了
DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果流机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。
OpenAI:如何用 Codex 在 28 天内极速打造安卓版 Sora
OpenAI发布工程博客,揭秘用Codex不到一个月打造Sora安卓版应用的过程。这款应用上线首日冲至Google Play下载榜第一,24小时内用户生成超百万视频,开发过程耗约50亿tokens,崩溃率仅0.1%。
5张 H800 带来 20 FPS 高保真实时虚拟人生成
传统扩散模型做视频生成速度慢、画面不稳定,难用于实时虚拟人场景。阿里Live Avatar框架将算法和系统一起设计,用TPP并行推理策略和RSFM机制等,5张H800 GPU能实现20 FPS高保真实时虚拟人生成。
硅谷一线创业者内部研讨:为什么只有 5%的 AI Agent 落地成功,他们做对了什么?
来自硅谷一线AI创业者数据显示,95%的AI Agent在生产环境部署失败,原因在于围绕模型搭建的脚手架不完善。文章基于研讨会内容,探讨AI Agent构建关键,如上下文工程、安全控制、记忆功能等,并指出待解决问题和未来方向。
拿下3D生成行业新标杆!昆仑万维Matrix-3D新模型鲨疯了,一张图建模游戏场景
昆仑万维推出3D世界生成框架Matrix - 3D,能从单图像生成高质量、轨迹一致的全景视频并还原可漫游3D空间。它优势明显,还突破多项技术难题,背后是昆仑万维对空间智能的战略布局。
谷歌Veo 3玩法大升级!“360°”关键词解锁3D效果,Fast版同分辨率价格暴降5倍
谷歌旗舰视频模型Veo 3玩法再升级,添加“360°”提示词可解锁3D环绕效果。其Fast版速度更快、价格更便宜,同分辨率下价格暴降5倍,虽面部细节和光照表现有下降,但解决了部分问题。
当 AI 开始重写负载,数据库该如何重新设计?
AI正改写数据库命题,新数据对象进入生产链路,AI Agent带来更复杂任务链路。在腾讯云数据库DBTalk上,三位研究员从不同方向探讨当负载被AI改写,数据库该如何重新设计,包括内核优化、资源管理和测试测评等方面。
Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板
Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。
Slack 淘汰 SSH:700+ EMR 作业迁移至基于 REST 的调度架构
Slack 完成大规模数据平台改造,将 Amazon EMR 数据处理流程中 SSH 作业执行模式替换为基于 REST API 的统一调度架构,移除对生产集群的直接 SSH 访问,迁移 700 多个 Airflow Operator,解决了安全、运维等问题。
ICML 2026 Oral | 为3D空间智能数据构建全自动数据飞轮,Holi-Spatial打造400万级空间多模态数据集
来自多机构的研究团队提出 Holi - Spatial,可从原始视频自动生成 3D 重建等数据,构建 400 万级空间标注数据集 Holi - Spatial - 4M,提升 VLM 空间能力,还形成自动化数据飞轮,但存在计算成本高、特定场景表现不佳等局限。