开源动态8
MMDR - Bench:多模态研究有了可核验评测标准
机器之心
AI 摘要
俄亥俄州立大学等:发布 MMDR - Bench,为多模态 Deep Research 设立可核验评测标准,将评估分 3 段管线,可改变系统迭代方式,让 deep research 进入可工程化时代。
阅读原文 · 机器之心
多模态Deep Research,终于有了「可核验」的评测标准
俄亥俄州立大学与 Amazon Science 等联合发布 MMDR - Bench,将多模态 Deep Research 评估拉到可核验标准。它含 140 个专家任务,覆盖 19 领域,把评估拆成 3 段管线、12 指标,强调过程证据链。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
华为:RL训练强大的Deep Research Agent
华为技术团队发布综述论文,首次系统性梳理利用强化学习(RL)训练强大的深度研究代理。论文指出传统SFT和DPO方法有局限,RL优势明显,还在数据构建、算法设计等方面给出进展与路线图。
深度学习自然语言处理
开源动态8
首个开源多模态智能体超越多个闭源方案
首个开源多模态Deep Research Agent登场,整合多种工具并优化决策。其WebWatcher技术方案覆盖全链路,实验中在四大核心领域领先主流模型,展现复杂推理和信息检索实力。
量子位
算法论文8
清华等提出医学基准MedXpertQA评测模型
本文由清华和上海AI Lab学者撰写,提出专家级医学基准MedXpertQA。现有医学基准难度和临床相关性不足,而MedXpertQA极具挑战、临床相关性高,构建严格,评测显示前沿模型在医学领域提升空间大。
机器之心
开源动态7
27.2k Star FastMCP:让MCP工程化
文章介绍了27.2k Star的FastMCP,它是Python MCP应用框架,能让普通Python函数成为MCP工具。讲了其适合场景、省事原因及上线安全边界,还给出了适用人群和注意点。
小华同学ai