机器人视觉」共找到 1499 篇相关文章

算法论文8

MIT成果登Nature正刊:90天,「AI科学家」完成3500次电化学测试

美国麻省理工学院李巨团队在Nature发表论文,展示多模态机器人平台CRESt。它结合多模态模型驱动的材料设计与高通量自动化实验,大幅提升催化剂研发速度和质量,还解决了实验结果可重复性不足问题。

新智元
算法论文8

去掉像素中介!上海交大让AI边看边想边画,用同一个“大脑”跨模态推理

上海交大等团队提出LatentUM架构,摒弃像素解码中介,在共享语义潜空间跨模态思考。它用MBAQ技术转化视觉特征,设计MoME架构,还能自我反思、规划路线、模拟世界演变,表现出色。

AIGC开放社区
新闻资讯7

时隔两月,Mistral AI终于上新Medium 3,近期还有「One more thing」

时隔两月,Mistral AI 推出 Mistral Medium 3,性能介于轻量级和大规模模型间,优于 GPT - 4o 等。未开源,可通过官网等使用,专为企业设计,成本低。还预告将推「大型」产品,同时推出企业聊天机器人 Le Chat Enterprise。

机器之心
算法论文8

只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026

多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。

量子位
新闻资讯7

2026,最惨一年?Optimus全员拼到死,清华校友跳槽到特斯拉

苹果核心华人AI科学家Yilun Chen转投特斯拉Optimus团队。马斯克透露AI芯片进展,特斯拉AI软件副总裁预警2026年是艰难一年。同时,部分特斯拉核心工程师出走至初创公司,硅谷投资人看好家用消费级机器人

新智元
算法论文8

Sora没做到的,LongVie框架给解决了,超长视频生成SOTA

视频生成近年进步大,但生成超1分钟高质量长视频仍难。上海人工智能实验室等机构提出LongVie框架,解决时序不一致和视觉退化问题,还推出评测基准LongVGenBench,该框架在多项指标达SOTA。

机器之心
8

先用为快——企业微信 AI 新版深度剧透

本文深度剧透企业微信 AI 新版,其升级对 AI 办公解读和实践领先,场景把握佳。新增智能搜索、智能总结、智能机器人等套件,还有智能表格、邮件等特性,还升级海外版与私有部署版本。

MacTalk
新闻资讯8

今年 AGI 大会上,这 10 个创业团队最受关注

在 AGI Playground 2026 的 Founder Show 活动上,10 个创业团队展示项目,横跨 Agent 基础设施、Physical AI 等方向。如 Tap8 实时生成交互视频,EigenFlux 为 AI Agent 建网络,Aceii One 是 AI 网球机器人等。

Founder Park
7

一份最新具身智能中的世界模型&安全综述

本文分享2篇具身智能世界模型和安全挑战的综述。2025年10月的综述用三维坐标轴整合文献。还介绍世界模型分类、性能表现,围绕自动驾驶与机器人领域分析安全隐患并实证评估。

PaperAgent
产品应用8

Qwen3-LiveTranslate:视、听、说全模态同传大模型!

Qwen3-LiveTranslate-Flash 是基于大语言模型的多语言实时音视频同传模型,依托 Qwen3-Omni 能力与海量数据,有多语言和方言支持、视觉增强等亮点,性能超主流大模型。

通义千问Qwen