多模态强化学习」共找到 2301 篇相关文章

算法论文8

登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球

今年8月,清华赵明国教授团队联合字节跳动Seed等在《Science Robotics》发表论文,提出视觉驱动的反应式足球技能学习框架。该研究历经22年技术接力,成果在真机和赛事中验证,加速进化平台助力研究。

机器之心
产品应用8

谷歌深夜双发!最便宜Nano Banana来了

谷歌深夜上线Nano Banana 2 Lite和Gemini Omni Flash。前者是最快最便宜文生图模型,4秒生图且成本低;后者是视频生成模型,支持多模态输入和对话式编辑。二者串联打通创作流水线,还集成SynthID水印技术。

新智元
新闻资讯7

半年复盘,AI迎来预训练后的新瓶颈。

2025年上半年AI领域发展加速,编码和多模态能力提升。但模型在综合能力上遇到第二轮瓶颈,编码能力强时通用认知能力‘拉胯’,或与RL阶段使用编程数据有关,红杉新基准或推动模型均衡发展。

探索AGI
新闻资讯7

Ilya的第一个模型,被曝本月上线

新智元报道,投资人Gavin Baker称Ilya Sutskever创立的SSI本月将发布首个模型。他还提及持续学习等技术或影响英伟达显卡需求,且指出Claude成华尔街“克朗凯特”,带来市场共识同质化。

新智元
产品应用8

审美在线、随叫随到、月薪19刀——Lovart把AI设计师这件事做认真了

Lovart适合无设计预算的人,将专业设计师装进AI工具。其Brand Kit解决风格不稳定问题,Font Generator可生成专属字体,Create Skill能固化学习成本,还有Export PSD、Mock Up等实用功能,月费仅19美元。

AI寒武纪
新闻资讯8

Meta 143亿挖角后的首个作品:Alexandr Wang 推出闭源模型,杨立坤点赞

沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,在多领域有应用潜力。不过闭源引争议,且在部分领域有短板。

InfoQ
产品应用7

面向业务落地的AI产品评测体系设计与平台实现

文章聚焦淘宝闪购技术部AI产品评测,先介绍AI业务应用场景与评测挑战,接着阐述评测体系从多方面思考的要点,包括评价维度、评测方式等,还提及平台建设成果,最后展望未来多模态评测等规划。

阿里云开发者
算法论文8

邱锡鹏团队新作:让机器人学会「察言观色」

复旦大学邱锡鹏团队等发布全新操作框架 RoboOmni,突破传统 VLA 依赖显式指令局限。它融合多模态信号,构建数据集,在成功率等方面超基线,以跨模态指令让机器人主动推断意图,开启具身智能‘共情时代’。

AI科技评论
算法论文7

GPT-6要「活」了?MIT新作曝光,AI「自进化」不远了

麻省理工学院推出全新自适应大模型框架「SEAL」,让模型从「被动学习者」变为「主动进化者」。网友猜测GPT - 6可能整合其能力,成为能自主学习的模型,研究虽有局限,但为大模型自进化提供新路径。

新智元
算法论文8

DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角

DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态大模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。

AI寒武纪