实时长视频」共找到 1778 篇相关文章

算法论文8

OmniInsert:全新无掩码视频插入技术

基于扩散模型的视频插入技术发展快,但以往方法有局限。字节提出InsertPipe和OmniInsert,解决数据不足等难题。OmniInsert设计巧妙,还建立评测平台InsertBench,虽有小问题,但推理快,可加速优化。

带你学AI
开源动态8

2.1K Star 本地实时数字人!阿里开源低延迟数字人系统,2.2秒实时响应!

阿里在GitHub开源轻量本地实时数字人对话系统OpenAvatarChat,摆脱高性能硬件依赖等问题。它平均回答延迟2.2秒,有100+预置形象,支持多模态交互,提供多种部署方式,适配多场景。

开源星探
算法论文8

VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应

多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。

机器之心
产品应用7

字节推出全新视频换装框架DreamVVT

视频虚拟试穿技术受关注,但现有方法有局限。字节推出DreamVVT框架,基于扩散变换器,分两阶段试穿,能应对多种复杂场景,不过也存在依赖遮罩、复杂动作表现不稳定等问题。

带你学AI
开源动态8

视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理

快手开源能看懂视频并跨模态推理的大模型Keye-VL 1.5,其有时序定位、描述和推理能力,跑分领先。采用三段式架构和Slow-Fast编码策略,经四阶段预训练和多阶段后处理,团队成果多,推动多模态技术落地。

量子位
开源动态7

刚刚微软开源视频录制技能skill-recorder

微软开源视频录制技能 Skill Recorder,能将用户完成任务的过程转化为 AI 智能体可重复执行的技能。它捕获屏幕工作会话,用 GitHub Copilot CLI 重构操作,生成可复用内容,支持多平台。

GitHubStore
推荐文章7

自动驾驶优化:从复杂性到实时工程

本文深入探讨自动驾驶技术栈端到端架构,阐释从上下文感知传感器融合到MPC求解器等优化技术,如何将原始传感器数据转化为安全控制指令,还介绍轨迹规划、实时计算预算及调试等内容。

InfoQ
新闻资讯7

上下文窗口、Agent崛起,RAG已死?

技术迭代下“RAG已死”论调出现,向量数据库Chroma创始人主张用上下文工程框架取代对“RAG”的狭义依赖。文章梳理业界不同观点,有人认为RAG在进化,有人称其成工程学科,也有人觉得会被Agent和上下文取代。

机器之心
推荐文章7

爆肝一周看6小时视频,解读AI时代程序员价值几何

作者花一周看完Lex Fridman对丹麦传奇程序员DHH的6小时访谈。DHH分享编程经历,谈对流行技术看法,认为AI不能取代人类创造力,还谈及创业、开源等观点,展现深刻认知与独特态度。

MacTalk
算法论文8

打破视频理解瓶颈:HoPE混合位置编码提升VLM度泛化能力

如今视觉语言模型在上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM度泛化能力。

机器之心