具身操作评测」共找到 2034 篇相关文章

推荐文章8

大模型微调评测入门:看懂这些指标,才知道模型好不好

文章指出大模型微调中很多新手重“调”轻“评”,评测是决定模型落地的关键。介绍分类和生成任务评测指标,给出实操步骤,还说明如何综合判断模型好坏,最后展望评测技术朝自动化等方向发展。

机器学习AI算法工程
新闻资讯8

击败PI!星动纪元登顶身奥林匹克,狂揽三项全球冠军

身灵巧操作奥林匹克赛事Benjie’s Olympics中,中国身智能公司星动纪元斩获三项全球第一,超越美国明星公司PI。其自研VLA身模型优势显著,且已在多领域落地应用。

量子位
算法论文7

大模型在身推理上「翻车」了?4496 道题全面揭示短板

美国东北大学等提出BEAR基准评估MLLM身智能子能力,用4496道题测试20个模型。发现多模态大模型身能力不足,还分析错因,开发BEAR - Agent提升模型身推理能力,在仿真测试中效果显著。

机器之心
开源动态8

AI医生终于有了硬标尺!全球首个专病循证评测框架GAPS发布,蚂蚁联合北大王俊院士团队出品

蚂蚁健康与北大王俊院士团队发布全球首个大模型专病循证能力评测框架GAPS及评测集GAPS - NSCLC - preview,解决现有医疗AI评测局限,成果已应用于“蚂蚁阿福”,并客观评价了大模型临床能力。

量子位
产品应用7

身智能的第四阶段:「造系统」?

进入2026年下半年,业内形成共识:身智能竞争从单一模型比拼转向系统工程与产业基础设施角逐。鹿明机器人推出身智能开发与验证平台Lumos Station Lite,提出“产业身”理念,助力身智能落地。

AI科技评论
开源动态8

突破身智能任务规划边界,刷新身大脑多榜单SOTA,中兴EmbodiedBrain模型让身大脑学会「复杂规划」

当前主流大语言模型在身任务场景面临瓶颈,中兴星云大脑团队推出身视觉 - 语言基础模型 EmbodiedBrain,构建全流程创新框架,在架构、数据训练、评估体系等方面有突破,还将开源成果推动生态发展。

机器之心
新闻资讯7

身进化·无界未来:这场论坛引领身智能模型革命新浪潮

5月29日,2025张江身智能开发者大会相关论坛举行,汇聚专家探讨热点话题。张江集团推动产业发展,多位嘉宾分享成果与思考,圆桌对话也各抒观点,为身智能发展描绘蓝图。

机器之心
新闻资讯8

击败PI ,清华系身公司包揽「身奥林匹克」三项全球第一,刷新世界纪录!

在Benjie's Olympics赛事中,星动纪元凭借自研身智能模型获三项全球第一,击败身领域老牌公司PI。该赛事规则严苛,星动纪元在剥橘子、开锁、翻袜子任务中表现出色,此前其在技术研发和场景落地也成果颇丰。

AI科技评论
新闻资讯7

破解「有身无脑」困局,首届身智脑技术生态大会即将启幕

人工智能向物理世界延伸的身智能正重塑机器人产业。当下其处关键节点,但国产机器人‘有身无脑’。身智脑可解决该问题。3月27日首届身智脑技术生态大会将启幕,有成果发布与多元交流。

机器之心
新闻资讯7

独家 | 华为19级天才少年赵立晨离职创业,瞄准身 Agentic OS

AI科技评论独家获悉,前华为天才少年、19级技术专家赵立晨2026年3月离职,加入杭州拉格朗日身技术有限公司。该公司聚焦身智能架构研发与硬件规模化落地,赵立晨想做的Agentic OS是身产业化的基础设施。

AI科技评论