「高刷视频理解」共找到 1647 篇相关文章
NVIDIA开源“Banana”级黑科技!会懂物理、理解时间的图像编辑模型!
继谷歌Banana后,英伟达开源物理级图像编辑模型ChronoEdit - 14B,被称‘NVIDIA版的Banana’。它有‘时间观念’和‘物理常识’,能按描述生成符合物理规律图像,适用于多领域。
DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案
DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。
深刻理解Token:大语言模型(LLM)是如何看待这世界?
文章指出在大语言模型(LLM)中,Token是处理文本的基本单位。介绍了Token的概念、分词方法、向量化过程,还阐述了分词对模型性能的影响,如导致模型在数学、多语言处理上表现不佳等。
让龙虾看懂屏幕!谷歌多模态新成果,文本图像视频音频进同一空间
谷歌发布首个原生多模态嵌入模型Gemini Embedding 2,将文本、图像、视频、音频和文档映射进同一嵌入空间,支持多模态混合输入,为AI Agent“看懂”世界提供关键基础,已展开公测。
从Sora2到TapNow:AI视频创作,差的是这套专业流程
国内知名导演欧阳英豪用AI打造百万级商业TVC,TapNow公开其创作流程。当下AI视频工具强,但能用于商业的TVC少,核心问题是不懂专业流程。TapNow将专业流程工具化,有五大核心功能,适合不同层次创作者。
让AI自我进化?斯坦福华人博士答辩视频火了,庞若鸣参与评审
斯坦福大学博士生 Zitong Yang 完成「持续自我提升式 AI」博士论文答辩并分享视频。他针对当前模型局限提出解决方案,涵盖合成持续训练、预训练能力自我提升、迈向 AI 设计 AI 三个核心方向,引发行业关注。
浙大联手字节:开源大规模指令跟随视频编辑数据集OpenVE-3M
浙江大学与字节跳动合作,提出大规模指令跟随视频编辑数据集 OpenVE-3M,有 3M 样本对。还提出数据构造管线、编辑模型 OpenVE-Edit 及评测集 OpenVE-Bench,小参数量下超越现有开源模型。
多模态长文本理解测评首发:46款模型无一攻克128K难关
香港科大等研究者联合提出MMLongBench,用于评估多模态模型长文本理解能力。它覆盖5大类型任务的16个数据集,对46个模型测试显示,闭源和开源模型在长上下文任务均面临挑战,OCR和跨模态检索能力是瓶颈。
CVPR 2026|AI开始会拍电影了:一分钟十镜头,全程不崩剧情
多镜头视频生成要求模型处理不同镜头间稳定信息和变化信息,现有方法有局限。Meta与哥本哈根大学研究者提出OneStory,建立跨镜头记忆机制,设计关键模块,实验表现好,为视频生成打开新可能。
25个实战案例告诉你:原来 Blender + Seedance 才是AI视频创作的终极组合!
文章介绍开源仓库Awesome-Blender-Seedance-Workflow-Usecases,汇集25个Blender与Seedance结合的实战案例。阐述两者组合原理及优势,展示多类案例亮点,还给出快速上手指南,体现人机协作创作新理念。