「视频推理」共找到 2907 篇相关文章
VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
字节推出全新视频换装框架DreamVVT
视频虚拟试穿技术受关注,但现有方法有局限。字节推出DreamVVT框架,基于扩散变换器,分两阶段试穿,能应对多种复杂场景,不过也存在依赖遮罩、复杂动作表现不稳定等问题。
SGLang 确定性推理实现技术细节笔记
文章围绕SGLang确定性推理展开,介绍其启用方式,详述批次不变性原理与Batch Invariant Ops实现,如Matmul Persistent Kernel设计;还阐述确定性采样、Attention Backend配置、AllReduce改动等,给出环境变量及测试脚本,有完整解决方案。
英伟达揭示RL Scaling魔力!训练步数翻倍=推理能力质变,小模型突破推理极限
学界对强化学习能否让模型学会新推理技能争论已久,过去研究多悲观。英伟达研究指出,问题源于任务在基础模型训练数据中过度呈现及训练步数不足。其ProRL框架提升训练步数,释放小模型潜力,还构建技术组合拳。
国产推理芯片,赢了英伟达?
算力市场风向生变,国产算力崛起。政策从资金、市场、规则多维度发力,为国产算力扫清障碍。在推理场景中,国产方案性价比更高。其独特分销体系使贸易环节信息透明度低,步入卖方市场,市场也迎来新局面。
刚刚微软开源视频录制技能skill-recorder
微软开源视频录制技能 Skill Recorder,能将用户完成任务的过程转化为 AI 智能体可重复执行的技能。它捕获屏幕工作会话,用 GitHub Copilot CLI 重构操作,生成可复用内容,支持多平台。
DeepSeek被曝自研AI推理芯片
据路透社报道,DeepSeek 正开发自研 AI 推理芯片,欲降低对英伟达和国产芯片依赖。此为重大战略转变,影响英伟达股价。虽有降本等好处,但面临技术、制造、生态等挑战。
让大模型异步地增强推理能力
在大模型推理时代,Test - Time Scaling成提升能力重要方向,但面临效率问题。ATTS提出异步框架,加入共形预测筛选候选路径,实验显示其加速显著,将测试时扩展推进到‘有原则加速’阶段。
大概念模型:AI 推理的新范式
大概念模型(LCM)是自然语言处理新范式,侧重结构化推理和理解,与 LLM 不同。它依赖结构化知识,可模拟专家思维,解决当前 AI 缺陷,文章还介绍其架构、应用、局限,探讨与 LLM 结合的未来发展。
把短视频做成流水线的AI剪辑神器
Pixelle-Video是一款AI剪辑神器,输入主题就能自动完成视频创作,零门槛。它采用模块化设计,流程清晰,各环节可灵活定制。支持多种AI模型、TTS方案,有丰富功能亮点。