视觉机器人」共找到 1503 篇相关文章

新闻资讯8

两张图定位全球,o3碾压T0级高手!人类「诡计」被看穿,跨模态推理爆表

OpenAI的o3在GeoGuessr游戏中与大师级玩家Sam Patterson对决,o3通过视觉与搜索推理,忽略伪造EXIF信息,最终以23179比22054获胜,展现出跨模态推理潜力,引发对AI推理能力的思考。

新智元
开源动态8

能识图、看视频,也能理解软件界面:蚂蚁百灵开源Ling-3.0-flash-VL

本文介绍蚂蚁百灵开源的多模态大模型Ling-3.0-flash-VL,该模型采用稀疏混合专家架构,支持图片、视频、软件界面理解,可将视觉信息用于推理与任务执行,开放权重采用MIT许可证供开发者部署测试。

AIGC开放社区
新闻资讯8

魔法原子登陆硅谷,行业首个「自进化具身大脑」发布

美西4月28日,国内具身智能企业魔法原子在硅谷主办全球具身智能创新大会。会上发布全域世界模型Magic - Mix、新一代灵巧手H01、旗舰人形机器人MagicBot X1,直面行业痛点,还披露全球化战略目标。

AI科技评论
8

Claude能直接操控你的电脑微信了,这才是真正的上位小龙虾。

Claude新发更新,可通过Computer use纯视觉方案操控电脑,还更新了远程操控Dispatch。这俩功能组合让Claude能操控微信等本地软件,使用简单,且权限管控和防护较好,更新速度快,领先同类产品。

数字生命卡兹克
算法论文8

打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26

现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。

量子位
产品应用8

对话 Seede AI:帮人类创作只是第一步,我们想帮人类理解 Agent 产出的内容

本文对话 Seede AI 创始人 Longyi,探讨 AI 设计产品发展。Seede AI 主打将原始素材转化为可交付设计稿,易上手、受众广。创始人认为不转向 AI - Native 没救,产品已跑通 PMF,目标是帮人类理解 Agent 产出内容。

Founder Park
新闻资讯8

华为重金押注的世界模型公司,新融了10个亿!

具身基模和通用机器人企业极佳视界完成近10亿元Pre - B轮融资。其具身基模全球领先,国内首家布局世界模型,原生本体开启量产,在多场景有开创性应用,获产业巨头和顶尖资本认可。

量子位
产品应用8

具身智能的「GPT时刻」?高德连发两个全面SOTA的ABot具身基座模型

过去几年,机器人行业面临模型与数据绑定特定场景、能力难以泛化的问题。近日,高德发布 ABot 系列具身基座模型,补齐行业能力缺口,标志具身智能从定制系统转向统一模型,有望降低开发门槛。

机器之心
产品应用8

Win版Claude Cowork杀疯了!140元雇个全职AI员工,全网首测真香

昆仑万维推出天工Skywork桌面版,专为Windows打造,能调用Claude和Gemini。实测显示,它可高效分类文件夹、提取图片、生成报告等。相比Claude Cowork,其在生态、视觉、模型等方面有优势,还降低了办公门槛。

新智元
开源动态8

阿里通义新年礼物:开源最强Qwen-Image-2512版本告别AI塑料感与文字乱码

通义万相新年前发布Qwen - Image - 2512版本。它是开源界最强文生图模型,在AI Arena盲测中表现出色。能消除AI塑料感,攻克文字渲染难题,在还原真实世界和重构视觉元素逻辑排版上有显著提升。

AIGC开放社区