「长视频理解」共找到 2145 篇相关文章
视觉领域的GPT-3时刻!DeepMind首次证明Veo3模型实现对物理世界建模和推理
谷歌DeepMind研究团队论文显示,视频模型Veo 3学会‘无师自通’,能处理多种没学过的视觉任务。研究人员将其能力分四级,还做了定量评估。研究认为机器视觉或正处范式转变边缘。
真实场景也能批量造「险」!VLM+扩散模型打造真实域自动驾驶极限测试
浙江大学与哈工大(深圳)联合推出SafeMVDrive,将VLM关键车辆选择器与两阶段轨迹生成结合,可在真实域批量制造高保真安全关键视频,用于端到端自动驾驶系统安全性测试。
ERNIE 5.0:走向原生统一的万亿参数多模态基础模型
过去多模态模型‘拼接式’方案存在理解与生成割裂问题,ERNIE 5.0 借此提出,用统一自回归框架做多模态理解与生成,在架构、训练与系统层面有创新,评测中各模态能力表现出色。
仅保留35% Token,性能反超原模型!快手可灵等用视觉信息引导音频压缩,推理时间直降42%
Omni - LLM计算浪费严重,快手可灵等团队提出OmniSIFT框架。它利用音视频非对称依赖关系,通过时空联合剪枝压缩视频、视觉引导筛选音频Token,大幅减少Token数量,提升性能和推理效率。
AI改造出行体验:滴滴的试验能否开启行业范式转变?
滴滴近日面向公众内测上线出行AI助手小滴,颠覆传统打车模式。它能精准理解需求,提供个性化方案,还可进行时空推理和订单规划。滴滴用工程打法攻克难题,还上线MCP服务助开发者定制助手。
Sora 2瑟瑟发抖!通义万相2.5放大招:一句话出1080P电影,音画精准同步
云栖大会上通义万相2.5系列模型亮相,包含四大模型,视频生成模型实现音画同步突破,降低电影级视频创作门槛。它创作能力全方位升级,支持多种模态输入,采用原生多模态架构。
画质重生,第一!腾讯TEG香农实验室斩获CVPR 2025 UGC Video Enhancement 冠军
CVPR NTIRE是计算机图像恢复与增强领域有影响力的赛事。在NTIRE 2025 UGC Video Enhancement中,腾讯TEG香农实验室团队自研算法夺冠,成果落地提升视频清晰度。团队还参加实时赛道获佳绩,且做了硬件推理优化。
阿里开源QwenLong-L1:首个以强化学习训练的长上下文推理大模型
LRMs扩展到长文本场景是挑战,阿里开源QwenLong-L1框架,是首个用强化学习训练用于长文本推理的模型。它含三个核心组件,QwenLong-L1-32B性能领先,与Claude-3.7-Sonnet-Thinking相当。
刚刚,OpenAI Sora 2重磅登场!首个APP上线,或将成为AI时代新TikTok
凌晨1点,OpenAI推出Sora 2,AI视频迎来「GPT - 3.5时刻」。它物理智能提升、实现音画同步,人物一致性等刷新SOTA。Sora App上线或重塑短视频交互与社区互动,还在安全治理上布下多层防线。
AI代码审核平台Greptile正洽谈3000万美元融资
TechCrunch消息,AI代码审查初创公司Greptile正洽谈3000万美元A轮融资,估值1.8亿美元。其由Dasksh Gupta创立,已获400万美元种子轮融资。代码审查领域竞争激烈,Greptile员工工作时长很长。