开源动态8
上交×蚂蚁:DiagGym驱动医学诊断智能体
机器之心
AI 摘要
上交与蚂蚁等团队发布DiagGym驱动诊断智能体DiagAgent。构建虚拟临床环境,让智能体学会动态决策。DiagBench评测显示,其性能远超多个大模型,未来可扩展模型规模与任务范围。
阅读原文 · 机器之心
上交×蚂蚁发布 DiagGym:以世界模型驱动交互式医学诊断智能体
上海交通大学与蚂蚁集团等团队提出新训练框架,构建面向医学诊断的世界模型DiagGym,训练诊断智能体DiagAgent,还设计评测基准DiagBench。实验显示该框架下的智能体表现优于先进模型,代码等已开源。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
李飞飞押注空间智能,破局之路在哪?
李飞飞押注的空间智能是世界模型主流路线之一,旨在让AI生成可操作三维世界。但当前AI生成世界存在“中看不中用”问题,构建“站得住”的世界面临速度与状态瓶颈,生境科技等实践提供了解决思路。
AI科技评论
新闻资讯7
MCP 走向无状态,社区看法不一
MCP 2026 - 07 - 28 规范取消协议会话,新增必需 HTTP 标头,可对智能体流量路由等。社区反应分歧大,有人认为无状态让 MCP 变回 REST API,也有人强调它是获 AI 提供商认可的标准。MCP SDK 下载量高,但服务器使用存问题。
InfoQ
开源动态7
多机构发布HarnessEval开启评测新时代
8月13日,DeepSeek开源Agent Harness dsh引发行业对“Harness”的关注。近日,MirroS联合多机构发布HarnessEval,将其概念引入评测系统。它使评测从Metric到Harness,形成可执行评测系统,已落地于交互式世界模型。
机器之心
产品应用7
6个Agent组团,Spellcaster打破游戏生成困局
过去大模型生成的游戏虽代码能跑,但常陷入“可玩性黑洞”。Spellcaster让多个专用Agent协同处理,形成“生成—运行—检查—修复”循环。目前能快速生成多种游戏原型,未来将用世界模型直接生成画面。
量子位