「动态视觉伺服」共找到 994 篇相关文章
GRPO训练不再「自嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化
GRPO在视觉生成流模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务中表现良好。
大模型思维链推理速度倍增!——RoT新框架把思维链「画」进隐空间
随着大模型规模扩展,思维链(CoT)成处理复杂推理任务标准范式,但显式CoT依赖长序列生成,隐式CoT面临优化挑战。腾讯提出RoT新框架,利用视觉编码器将文本推理步骤转为视觉嵌入,实现Token压缩与推理加速,且过程可分析。
机器人进入“边做边学”时代:星尘发布在线强化学习框架,让动态投掷成功率提升超141%
星尘智能基座模型团队公布在线强化学习框架SmoothRL,解决异步执行环境中具身模型在线微调难题。该框架让策略更新对应硬件实际执行,攻克延迟失准问题,在多项真机测试中大幅提升任务成功率。
万帧照片级仿真,打通视觉机器人学习的感知与物理鸿沟:国产仿真器GS-Playground入选RSS 2026
清华大学等联合提出高通量视觉高保真仿真器GS - Playground,被RSS 2026录用。它解决现有仿真器渲染开销高、资产制作依赖人工、Sim2Real迁移鸿沟大等问题,是全栈重新设计的仿真基础设施。
SceneSplat: 基于3DGS的场景理解和视觉语言预训练,让3D高斯「听懂人话」的一跃
文章引入 SceneSplat,首个在 3DGS 上原生运行的端到端大规模 3D 室内场景理解方法,提出自监督学习方案,构建发布 SceneSplat - 7K 数据集,在多个实验中达 SOTA 效果。
清华姚班团队,开源具身智能视觉语言动作(VLA)模型工具箱,打造行业通用技术底座
清华姚班团队所在的原力灵机公司,开源了基于PyTorch的视觉语言动作(VLA)模型工具箱Dexbotic。它能打造通用底座,解决行业研发困境,其预训练模型表现出色,还与Hugging Face合作推出评测平台。
32倍加速,58秒搞定720p视频!字节发布离散自回归框架,统一视觉生成和长视频生成
字节发布InfinityStar框架,将5秒720p视频生成时间从30多分钟缩至58秒,还支持多样任务。它基于对视频本质思考设计时空金字塔模型,将时空分离,通过多项技术优化,性能表现出色,不过也存在一些技术局限。
Ilya刚预言完,世界首个原生多模态架构NEO就来了:视觉和语言彻底被焊死
当Ilya断言大模型未来在于架构创新时,中国团队推出全球首个可大规模落地的开源原生多模态架构NEO。它颠覆传统拼接模式,从根上融合视觉与语言,以简洁架构证明架构聪明才是下一代AI竞争力。
仅保留35% Token,性能反超原模型!快手可灵等用视觉信息引导音频压缩,推理时间直降42%
Omni - LLM计算浪费严重,快手可灵等团队提出OmniSIFT框架。它利用音视频非对称依赖关系,通过时空联合剪枝压缩视频、视觉引导筛选音频Token,大幅减少Token数量,提升性能和推理效率。
ICRA 2026|NUS邵林团队提出T(R,O) Grasp:刷新跨智能体灵巧抓取SOTA,实现5FPS动态环境交互
新加坡国立大学邵林团队提出T (R,O) Grasp,这是基于物体—机器手空间关系建模的图扩散架构,有跨智能体统一表征能力,在多种智能体上平均抓取成功率达94.83%,刷新跨智能体灵巧抓取SOTA。