「长视频生成」共找到 3151 篇相关文章
DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案
DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。
浙大联手字节:开源大规模指令跟随视频编辑数据集OpenVE-3M
浙江大学与字节跳动合作,提出大规模指令跟随视频编辑数据集 OpenVE-3M,有 3M 样本对。还提出数据构造管线、编辑模型 OpenVE-Edit 及评测集 OpenVE-Bench,小参数量下超越现有开源模型。
无需训练的3D生成加速新思路:西湖大学提出Fast3Dcache
在AIGC浪潮中,3D生成模型虽进化快,但‘慢’和计算量大制约其应用。西湖大学AGI实验室提出无需训练、即插即用的Fast3Dcache框架,能在加速同时保持或提升模型几何质量。
告别直接生成,文生图进入Agent时代:港中文联合伯克利开源Gen-Searcher
过去文生图多是‘直接出图’,遇真实世界知识等易翻车。港中文等团队提出Gen - Searcher,让图像生成模型像Agent一样搜索等,数据、模型和代码均已开源,实验显示它提升了生图准确性和质量。
生成式推理再排序,可能会是LLM4RecSys的新突破口吗?
Meta AI研究者尝试把推理模型引入推荐系统再排序阶段。论文通过监督微调等赋予模型推理能力,超LLM4Recsys标杆。中期内化物品语意ID,生成推理路径,推理赋能再排序,披露重排序提升空间。
让外部知识“长入”模型:动态化与参数化 RAG 技术探索
检索增强生成(RAG)成大语言模型利用外部知识主流范式,但传统方法将其当黑箱,忽略动态需求和机制鸿沟。艾清遥博士介绍动态化和参数化检索增强技术,可提升准确性与适应性,减少计算开销。
低Token高精度!字节复旦推出自适应推理框架CAR
字节与复旦大学研究人员提出自适应推理框架CAR,能根据模型困惑度动态选短答或长推,在多基准测试中平衡了准确性与效率,打破长文本推理必然性能更好的认知。
自动生成n8n工作流!这个神级开源方案,绝了~
文章分享全自动构建n8n工作流的方案,核心是开源项目n8n - mcp,它是AI Agent的n8n外挂知识库,能让AI深度理解和使用n8n。文中介绍其安装、使用,还展示不同难度案例的生成效果。
25个实战案例告诉你:原来 Blender + Seedance 才是AI视频创作的终极组合!
文章介绍开源仓库Awesome-Blender-Seedance-Workflow-Usecases,汇集25个Blender与Seedance结合的实战案例。阐述两者组合原理及优势,展示多类案例亮点,还给出快速上手指南,体现人机协作创作新理念。
牛B, 我去,新手小白也能使用InfiniteTalk搭建属于自己的数字人啦 ,真的太简单啦!!!
文章聚焦InfiniteTalk,剖析数字人视频制作痛点,阐述其以“稀疏帧视频配音”破题,具备无限长度、全身与表情同步等优势,介绍核心功能、使用方法,对比同类项目,凸显其多方面优越性。