规模化评测」共找到 766 篇相关文章

算法论文8

Auto-Research「终极大考」:新基准撕下大模型科研伪装

来自多所高校的研究者提出MLS - Bench,用于解决现有Auto - Research评测的归因问题。它含140个真实研究任务,校准受控修改范围,主实验显示当前模型在方法发现上有明显缺口,Auto - Research需更严格评测标准。

机器之心
新闻资讯8

规模化破局:中国无人驾驶全球突围|甲子光年

在全球新能源与智能交通变革中,中国无人驾驶企业改写竞争逻辑。百度旗下萝卜快跑凭借12年研发,跨越‘用户规模断层’鸿沟,以‘倍速出海’策略在全球出行革命中争夺主动权,其出海模式与技术能力值得关注。

甲子光年
开源动态8

多模态Deep Research,终于有了「可核验」的评测标准

俄亥俄州立大学与 Amazon Science 等联合发布 MMDR - Bench,将多模态 Deep Research 评估拉到可核验标准。它含 140 个专家任务,覆盖 19 领域,把评估拆成 3 段管线、12 指标,强调过程证据链。

机器之心
新闻资讯7

人形机器人规模化前夜,硬件供应链是真正的深水区

过去三年,人形机器人行业投资火热,但供应链瓶颈成商业化关键制约。麦肯锡报告分析成本结构,指出执行器是成本大头且供应体系不成熟。全球供应风险分三档,中国供应链有优势,2035年格局或转变。

DeepTech深科技
开源动态8

世界模型评测的最大盲区,被这个新基准捅破了

过去一年,‘世界模型’成视频生成领域热词,厂商强调产品要模拟真实世界运行规律,但业界评测一直未能精准检验其‘物体恒存’的认知能力。为此,研究者提出新基准MemoBench,测试了主流模型,揭示其短板。

机器之心
算法论文8

Agent搜索哪家强?人大高瓴&快手联合发布全新评测基准GISA

人大高瓴与快手联合发布全新评测基准GISA,用于评估智能体搜索能力。它解决了现有基准反向构造、评估维度单一、答案易被记忆等问题,含373个高质量查询,实验显示当前搜索智能体距人类水平差距大。

PaperAgent
算法论文8

Seedream 4.0大战Nano Banana、GPT-4o?EdiVal-Agent 终结图像编辑评测

在AIGC下一阶段,图像编辑成检验多模态模型关键场景。研究者提出EdiVal - Agent评估框架,能自动化生成指令并多维度评估编辑结果,其评估与人类判断一致性高,还对比了13个模型的多轮编辑表现。

机器之心
产品应用7

全球首个跨本体、跨视角、多模态物理世界模型,CurrentWorld-0 来了!

Current Robotics 发布跨本体、多模态物理世界模型 CurrentWorld-0,它从真实数据学规律,整合跨本体、多视角和力触预测,可评测机器人,解决动作可控性等问题,让评测成训练数据入口。

机器之心
算法论文8

规范对齐时代:GPT-5 断层领先,让安全与行为边界更明晰

上海交通大学等团队提出规范对齐概念,构建评测基准 SpecBench 评测 33 个主流模型,发现多数模型有不足。还探索测试时深思方法,如 Align3 能提升规范遵循度,GPT - 5 在规范对齐上断层领先。

机器之心
算法论文8

警告:你的Agent可能无法"解决"真实世界的视觉问题

文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。

深度学习自然语言处理