长视频理解」共找到 2145 篇相关文章

算法论文8

ACL 2026|证据摊开看,场景图画清:让流式视频大模型拿捏「何时开口」

随着多模态和大语言模型发展,人类与 AI 交互走向共生。现有视频大模型难把握响应时机,西北工业大学等团队在 ACL 2026 提出 Response - G1 框架,实验显示其提升了模型性能。

机器之心
产品应用8

字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键

今天,字节正式发布豆包大模型 2.0 系列,围绕大规模生产环境需求优化,提供多款通用 Agent 与 Code 模型。其成本优势明显,多模态能力升级,未来将聚焦链路智能系统构建。

AI前线
算法论文8

对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准

文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。

AI科技评论
开源动态8

数据减少超千倍,500 美金就可训练一流视频模型,港城、华为Pusa来了

香港城市大学与华为香港研究所合作推出 Pusa 项目,它基于 FVDM 理论,可极低成本微调大规模预训练视频模型,成本降超 200 倍、数据减少超 2500 倍,代码已开源。

机器之心
推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【十二】|位置嵌入 - 给模型装上"GPS"

文章指出Transformer对词顺序不敏感,引出位置嵌入概念。介绍经典的函数编码、可学习位置嵌入法及新主流RoPE,还提及为让模型处理文本,在RoPE基础上用PI和YaRN等扩窗技巧。

AI大模型应用实践
算法论文8

VLA大模型做任务总断片?同济KC-VLA用关键帧链给治好了

VLA大模型记性是短板,处理非马尔可夫任务常束手无策。同济大学等提出KC - VLA框架,用关键帧链接赋予机器人全局时间感知能力,还构建了时序记忆依赖基准测试,实验显示其性能优越。

PaperAgent
产品应用7

实测Gemini图片转视频新功能,终于蹲到经典梗图后续了(doge)

Gemini接入带声音的图片转视频功能,作者实测该功能。用开盒指令测试,生成速度较快;还尝试给梗图加后续,发现生成精确内容需详细提示词,且不能生成具体真人形象内容。

量子位
算法论文8

无需训练,即插即用,2倍GPU端到端推理加速——视频扩散模型加速方法DraftAttention

高质量视频生成任务中,扩散模型成主流,但DiT模型注意力机制计算量大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,可2倍加速推理且不损画质。

机器之心
产品应用8

AI 模特时代到来:字节x清华推出商用级视频换装模型DreamVVT,保真度显著领先SOTA

字节跳动智能创作团队联合清华推出视频换装模型DreamVVT,基于Diffusion Transformer构建,用两阶段设计解决复杂场景痛点,支持多种输入,在保真度和时序稳定性上领先SOTA。

机器之心
推荐文章7

对话 Roto:让视频实时可交互、足够个性化,我们要做 AI 时代的 Netflix

Roto定位是全球首个互动开放世界视频平台。创始人David Xu曾就职独角兽企业,涉足多模态生成。团队经多次方向调整,决定大胆探索极致创新。目前产品技术不成熟,但已探索新内容形式,还将在广告实现商业闭环。

Founder Park