「视觉压缩」共找到 824 篇相关文章
让AI打游戏!能玩1000多款游戏,英伟达用4万小时视频训练出通用基础模型NitroGen
NVIDIA发布NitroGen模型,利用40000小时带按键显示的游戏视频,构建视觉-动作数据集,训练出能玩超1000款游戏的通用基础模型,在跨游戏泛化和微调任务中表现卓越,为具身智能发展提供新思路。
56倍加速生成式策略:西交大提出EfficientFlow,迈向高效具身智能
生成式模型在机器人和具身智能领域面临训练依赖大量数据、推理慢的问题。西安交通大学团队提出EfficientFlow,融合等变建模与高效流匹配,提升数据效率,压缩推理迭代步数,在多基准实现SOTA,推理提效显著。
用两个简单模块实现分割理解双重SOTA!华科大白翔团队等推出多模态新框架
华中科技大学和金山办公团队联合提出语义增强特征提取器(SEFE)和交错局部视觉耦合(ILVC)模块,构建多模态大模型LIRA,解决现有模型分割不精确和理解有幻觉问题,在分割和理解任务上达SOTA。
谷歌 DeepMind 发布机器人学基础模型 Gemini Robotics On-Device
谷歌 DeepMind 推出 Gemini Robotics On-Device,这是视觉 - 语言 - 行动基础模型,可在机器人硬件本地运行,低延迟且能针对特定任务微调。它是 Gemini Robotics 家族最新迭代,还发布相关基准测试。模型待广泛可用,SDK 可在 GitHub 找到。
告别「利用率崩溃」:GIPO开启大模型强化学习高效训练新方法 | ICML 2026
树根科技与三一集团团队联合提出 GIPO 算法,在机器人操控及大语言/视觉动作模型强化学习训练中,缓解了策略滞后痛点,改善了 PPO 硬截断引发的‘利用率崩溃’问题。介绍了 GIPO 算法原理、优势及实验结果。
多轮Agent蒸馏终于不翻车!港中文x通义新方法成功率暴涨18点,训练还快32%
香港中文大学联合阿里通义事业群提出TCOD训练方法,解决多轮Agent蒸馏稳定性难题。它只需对现有OPD代码做极少改动,提升了模型成功率,压缩行动步数,还减少训练时间,未来或成训练长程Agent标配。
全球AI双榜第一!力压谷歌Veo与Grok,Vidu Q3「参考生」之王归来
这个月初谷歌免费开放Veo 3.1视频生成能力,让AI视频更普及,但模型距‘能交付’仍有差距。Vidu Q3带着‘全家桶’回归,覆盖多领域,在权威评测榜单成绩优异,视觉、听觉和场景能力升级。
「百万级」视频推理数据集!30+顶尖高校联合发布
AI视频生成已能「画得像」,但不会「想得对」。VBVR推出百万级视频推理数据集,首次系统评测模型对空间、物理、逻辑和抽象的推理能力,发现顶尖模型通过率仅68%,推动视频AI从「视觉模仿」迈向「智能推理」。
ICLR 2026|首个微观世界模型MicroVerse来了,AI开始模拟看不见的世界
过去两年,世界模型成为大模型演进重要方向,但现有模型多聚焦宏观世界。本文提出MicroVerse模拟框架,将研究边界拓展到微观尺度,还推出MicroWorldBench评测基准和MicroSim - 10K数据集,推动AI从视觉模拟迈向科学模拟。
前端同事看走眼了,这个“游戏网页”其实全是AI写的!
Kimi K2.5上新,集视觉理解、代码生成等能力于一体,提供四种使用模式,其中Agent集群模式提效显著。实测显示其网页生成、动效理解能力出色,下一代K3模型或用新架构KDA降低计算成本。