「视频翻译」共找到 1067 篇相关文章
英伟达&MIT等推出Long-RL,长视频训练速度翻倍
英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。
Claude Code 学习最佳实践:NotebookLM 生成全套学习视频+卡片+测试题
文章介绍用NotebookLM学习Claude Code的最佳实践。有人将36篇Claude Code资料“喂”给它,生成含音视频的学习资料库。NotebookLM能多种形式输出,支持多类型输入,值得纳入日常工作流。
阿里开源 Wan2.2-Animate!统一角色动画和视频人物替换
阿里通义实验室开源 Wan - Animate,这是用于角色动画与替换的统一框架。它构建于 Wan 模型之上,支持角色动画和角色替换两项核心功能,性能超现有算法,还通过独特设计实现多种效果。
CUTE DSL学习笔记一 CUTLASS 4.3.5 CuTe DSL 文档翻译
本文是 CuTe DSL 4.3.5 文档翻译,介绍了其核心概念、使用方法、与 CUTLASS C++ 关系等。它通过 Python DSL 降低 CUDA Kernel 开发门槛,支持 JIT 编译、多种架构,还说明了当前限制与未来计划。
一手实测全新的Sora 2 - AI视频的ChatGPT时刻到来了。
OpenAI发布Sora 2和Sora APP,Sora 2是视频和音频生成模型,在运动质量、人物表演、音频生成等方面表现出色;Sora APP类似AI版抖音,有社交互动“cameos”功能,但产品未来尚不明朗。
让龙虾看懂屏幕!谷歌多模态新成果,文本图像视频音频进同一空间
谷歌发布首个原生多模态嵌入模型Gemini Embedding 2,将文本、图像、视频、音频和文档映射进同一嵌入空间,支持多模态混合输入,为AI Agent“看懂”世界提供关键基础,已展开公测。
从Sora2到TapNow:AI视频创作,差的是这套专业流程
国内知名导演欧阳英豪用AI打造百万级商业TVC,TapNow公开其创作流程。当下AI视频工具强,但能用于商业的TVC少,核心问题是不懂专业流程。TapNow将专业流程工具化,有五大核心功能,适合不同层次创作者。
让AI自我进化?斯坦福华人博士答辩视频火了,庞若鸣参与评审
斯坦福大学博士生 Zitong Yang 完成「持续自我提升式 AI」博士论文答辩并分享视频。他针对当前模型局限提出解决方案,涵盖合成持续训练、预训练能力自我提升、迈向 AI 设计 AI 三个核心方向,引发行业关注。
浙大联手字节:开源大规模指令跟随视频编辑数据集OpenVE-3M
浙江大学与字节跳动合作,提出大规模指令跟随视频编辑数据集 OpenVE-3M,有 3M 样本对。还提出数据构造管线、编辑模型 OpenVE-Edit 及评测集 OpenVE-Bench,小参数量下超越现有开源模型。
干掉同传?谷歌把AI同传放入所有耳机,顺手发了个颠覆性的AI浏览器
Google加速将Gemini融入核心产品线,向Google翻译引入其能力,带来实时语音翻译Beta版,提升文本语境理解,扩展语言学习工具;还推出实验性浏览器Disco,用AI重构网页浏览体验。