「视觉RL」共找到 901 篇相关文章
AI Agents,年中总结!
文章梳理6月旧金山AI Engineering World's Fair重磅分享,指出AI Agent发展方向是成为自主处理复杂工作的助手,还介绍了Ambient Agents崛起、Agent UX设计两派观点、训练进入RL时代等关键趋势。
刷榜自动驾驶语义场景补全!北大新作:高维度、高密度 | AAAI'26
北京大学彭宇新教授团队提出视觉语义场景补全方法HD² - SSC,通过高维度语义解耦和高密度占用优化,解决现有技术维度与密度差异问题,在两自动驾驶数据集上取得最优性能。
VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破
当前VLA模型常依赖视觉线索而非语言指令,导致新场景表现不佳。论文提出LangForce方法,引入对数似然比损失,强化模型对语言的依赖,提升分布外泛化能力,还保留语言核心功能。
让AI学着“看菜下碟”!港中大等新框架让推理长度减少90%,准确率反增17%
香港中文大学等研究者提出TON选择性推理框架,使视觉语言模型能自主判断是否推理。该框架有两阶段训练机制,实验显示其让推理长度最多减90%,准确率还提升,有益模型部署。
北大卢宗青团队新作:超 70% 实机成功率,支持语言指令的功能性抓取系统
现有抓取研究多在稳定性层面,而功能性抓取更接近真实世界的智能。北大卢宗青团队提出DemoFunGrasp方法,对功能性抓取重新建模,在仿真与真实场景均超70%成功率,还引入视觉语言模型让机器人理解语言指令。
独家 | 破壳机器人完成亿美元级融资:「操作」才是具身落地的最大挑战
AI科技评论获悉,通用具身智能公司破壳机器人完成亿美元级Pre - A轮融资。其聚焦机器人操作能力,采用“WAM×RL×DATA”飞轮体系实现快速迭代,还推进软硬件联合研发探索具身落地。
将文章、故事变成漫画脚本提示词参考
文章给出将文章、故事变成漫画脚本的提示词参考,包含生成脚本和画图示例对话,从视觉风格、封面设计、布局、叙事结构、对话与文字设计等方面提出详细要求,为漫画脚本创作提供指引。
一个模型读懂所有医学数据,Hulu-Med探索医学大模型开源新范式 | 浙大x上交xUIUC
Hulu - Med是浙大、上交、UIUC等联合提出的通用医学视觉语言大模型,首次在单一模型统一理解医学多类数据。它开源透明,训练成本低,性能媲美GPT - 4.1,为医学AI带来新范式。
MiniMax M2.5发布:硬刚 Claude Opus,一美元包断一小时的生产力
MiniMax M2.5发布,硬刚Claude Opus 4.6,以一美元包断一小时的低价降低AI生产力门槛。它在编程、办公等多场景表现出色,速度快且成本低,背后是RL Scaling等技术支撑。
DeepSeek开源的不仅仅是个新OCR模型。。。
DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。