「多模态视觉理解模型」共找到 1933 篇相关文章
阿里新研究:统一了VLA和世界模型
阿里达摩院等提出WorldVLA框架,融合视觉语言动作模型与世界模型。它用三套分词器编码,解决传统自回归模型问题,经联合训练,实验显示其性能优,两模型还能相互助力。
均值至上假繁荣!北大新作专挑难题,逼出AI模型真本事
当强化学习成大模型后训练核心工具,主流方法陷入「均值优化陷阱」,推理能力停滞。北大团队提出RiskPO,将风险规避理念融入优化目标,用MVaR+捆绑策略双管齐下,三大任务表现优异。
一图胜千言被实现了!DeepSeek-OCR用图片压缩文本,10倍压缩率
DeepSeek开源DeepSeek - OCR,用图片压缩文本达10倍压缩率且几乎不丢信息。它解决了以往视觉编码器的问题,架构清晰,数据丰富,性能测试亮眼,为解决大模型‘记性差’问题提供新思路。
突发!OpenAI深夜推出浏览器ChatGPT Atlas:一文深度详细解析「率先支持mac OS」
OpenAI推出人工智能驱动的浏览器ChatGPT Atlas,集成对话式AI改变上网方式。它有随行聊天、浏览器记忆、代理模式三大核心功能,面向全球macOS用户上线,更高级功能对付费用户开放,还注重安全与用户控制。
具身智能迎来ImageNet时刻:RoboChallenge开放首个大规模真机基准测试集
近日,RoboChallenge推出全球首个大规模、多任务真机基准测试。它构建开放、公正、可复现的‘真实考场’,为视觉 - 语言 - 动作模型提供评估标准,推动具身智能发展,还提供远程测试服务等。
突发!Meta刚从OpenAI挖走了清华校友宋飏
刚刚,OpenAI前高层研究员宋飏加盟Meta Superintelligence Labs任研究负责人,向赵晟佳汇报。此次人事流动或透露出Meta在AI竞赛中释放的三重信号,如MSL人才拼图更完整等。
宇树科技开源UnifoLM-WMA-0机器人模型,离通用机器人又进一步
宇树科技开源UnifoLM-WMA-0模型,用神经物理网络让机器人理解力学规律。它支持两种模式,融合多模态信息,架构精妙。经测试性能强,已真机部署。开源降低门槛,有望推动行业发展。
号称视频编辑领域的开源nano banana来了,用文字就能改视频
DecartAI开源Lucy Edit模型,号称视频领域开源Nano Banana,能理解自然语言指令改视频。如输入指令可精准换服装等,渲染快,有身份保持和动态适配亮点,有多个版本,应用场景广。
字节发了个机器人全能大模型,带队人李航
字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。
刚刚,李飞飞主讲的斯坦福经典CV课「2025 CS231n」免费可看了
斯坦福大学经典CV课程《CS231n:深度学习与计算机视觉》(2025春季)正式上线,学生能学习实现和训练神经网络。课程由李飞飞等四人主讲,全部18个视频可在Youtube免费看。