具身操作评测」共找到 2039 篇相关文章

算法论文8

检索做大,生成做轻:CMU团队系统评测RAG的语料与模型权衡

CMU团队在最新ECIR接收论文中,系统评估RAG语料规模与生成模型规模替代关系。实验表明,语料扩容可让小模型追上大模型,提升主要来自证据覆盖。研究为RAG系统提供更性价比提升路径。

机器之心
产品应用8

鹿明发布NexCore:当机器人技能成为一种基础设施

8月19日鹿明机器人发布身智能进化引擎Lumos NexCore,试图在数据、模型等与机器人间建立生产与运行链路,让机器人能力成可复用‘技能资产’,解决身智能技能生产效率问题。

机器之心
8

奇绩创坛 2025 春季路演:Agent、身、Infra、AI4S,57 个项目完整介绍

奇绩创坛2025年春季创业营路演日,57家公司参与。项目集中在场景智能、空间/身智能等方向,覆盖AI Agent、智能硬件等赛道,还展示了前沿科研和创业项目。文章介绍了各项目的一句话介绍、简介和团队情况。

Founder Park
开源动态8

15个前沿大模型,100个职业场景:谁才是最强AI打工人?

通义千问与港中文联合发布OccuBench,用语言世界模型评测AI Agent职业能力。评测15个前沿模型,发现无全能选手,隐式故障难处理,Scaling定律有效,做Agent和环境模拟器能力不同,还给出体案例。

AI科技评论
开源动态8

Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

近年来,Coding Agent 发展迅速,「AI 软件工程师」渐成现实。但目前缺少系统评测其从设计稿开发产品能力的公开 Benchmark。为此,多校研究团队推出 VISTA,可多维度评测 Coding Agent 开发能力,且持续更新。

机器之心
开源动态8

顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤

UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。

AINLPer
开源动态7

Trae-Agent 刚刚开源,Windows-MCP 操作你的电脑,Chrome MCP 让AI自动化完成浏览器任务。

Trae - Agent 开源,可完成软件工程任务。Windows - MCP 能让 AI 操作 Windows 系统,Chrome MCP Server 使 Chrome 成 AI 助理。还介绍了 Gemini Cli、Claude 等工及特点。

AI进修生
算法论文8

最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代

人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。

机器之心
新闻资讯7

5Y News|诺亦腾机器人完成Pre-A+轮融资

诺亦腾机器人近日完成Pre - A+轮融资,由启明创投领投,多机构参与或追加投资且超额认购。资金用于身智能技术研发等,其创始人称是对技术和长期主义的认可,五源合伙人看好其推动身智能行业发展。

五源资本 5Y Capital
新闻资讯8

挤不动的世界机器人大会上,自变量秀出了真·通用身智能

2025世界机器人大会上,自变量机器人展示多项成果。通用轮式双臂机器人“小量”“小白”能完成制作香囊、家务整理等任务;“量子2号”仿人形机器人动作精准自然;其身智能基座模型WALL - A有强大泛化性。

机器之心