「视频RAG」共找到 1176 篇相关文章
阿里刚刚开源了一款影视级配音项目,口型同步、音色转换都不是事!
阿里通义实验室语音团队联合中科大发布多模态电影配音模型Fun - CineForge,开源模型并构建中文电视剧配音数据集。它能处理多种场景,有视频理解等亮点,还给出制作数据集步骤。
LightX2V fp4 quant kernel代码笔记
这是关于 LightX2V 里 `lightx2v_kernel` 做 FP4 量化 GEMM 的读码笔记,解释接口和约束、kernel 关键路径等问题,还介绍 NVFP4 和 MX-Formats 量化原理、代码实现,以及 LightX2V 项目中的实际使用。
雇佣过目即忘的天才:为什么企业级AI总在浪费钱?| 甲子光年
当下企业级AI缺乏连续性、动态数据割裂,主流外挂RAG的解法无法解决‘认知’问题。红熊AI的‘记忆熊’开源,构建记忆系统结合Agent平台,解决多场景痛点,还将推动记忆科学‘芯片化’。
G2ConS将微软GraphRAG的成本被打下来了~
传统Text - RAG处理多跳推理表现不佳,GraphRAG虽能提升准确率,但成本高。作者提出G2ConS方案,在3个多跳QA基准全面SOTA,平均节省30%费用,EM提升31.44%,整体流程仅3步。
用完这张无限可能的AI画布,第一次感觉人类导演要失业了!
2024年7月上线后迅速风靡海外的SkyReels发布最新版本,它重构AI创作生态,打通「图片—音频—视频」全栈,集成多种功能于一张画布,还推出专家智能体,让普通人轻松创作高质量内容。
国产开源LLM大爆发,Qwen、Minimax、美团、腾讯~
近期国产开源LLM大爆发,Qwen3-VL家族新增模型,有技术亮点且可免费商用;MiniMax-M2为编码和代理任务打造;美团LongCat-Video、LongCat-Audio-Codec各有专长;腾讯混元世界 - 镜像用于3D几何预测。
苹果传统强项再发力,视觉领域三种模态终于统一
苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。
MultiAgent架构实践:如何打造GitHub Stars 2.8k的ComfyUI-Copilot V2.0
ComfyUI是Stable Diffusion生态中可视化编程工具,但使用有难度。ComfyUI - Copilot V2.0基于多智能体协作框架构建,能实现对话开发、报错修复等功能,还介绍了其架构、技术栈及多智能体设计思路等。
波士顿动力 | 人形机器人Atlas ,最新研究进展!
世界人形机器人运动会引发对自主机器人的讨论。波士顿动力与丰田研究院合作为 Atlas 开发大型行为模型(LBM),使其能自主完成复杂任务,研究团队展示成果并介绍模型构建流程、实践成果及研发原则。
美国知名风投 BVP 年度 AI 报告:Memory 和 Context 将是新的护城河
美国知名风投 BVP 发布《The State of AI 2025》报告,研究 20 家 AI 创业公司,梳理 2025 年 AI 创业现状,认为记忆和上下文是新护城河,还对未来趋势如浏览器竞争、视频生成等进行了预测。