开源动态7
上交大开源AI诊断测评集
量子位
AI 摘要
上交大与SII:开源DiagnosisArena测评集评估AI诊断能力。结果显示,当前模型在复杂诊断任务中表现差,o3准确率仅51.12%,选择题不能反映真实水平,AI离像医生一样诊断还很远。
阅读原文 · 量子位
AI还不会独自问诊,o3准确率仅为51.12%,上交大×SII开源高难度复杂疾病诊断测评集
上海交大与SII团队开源高难度复杂疾病诊断测评集DiagnosisArena。测试显示,现有大模型在复杂临床诊断任务中表现不佳,o3准确率仅51.12%,且选择题设置无法反映其真实能力。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
推荐文章7
董舒:AI数字员工催生OPC一人公司
OpenHex董舒认为AI最大价值是替人出面干活,提出数字员工概念。他指出判断力密度高的岗位易被AI取代,中国服务业有发展机会。还辨析数字员工类型,介绍其平台OPS Agent,最后分享了数字员工相关Q&A。
AI科技大本营
推荐文章8
TypeScript 之父:AI 杀不死老语言,初级工程师不会被取代
前 Meta 资深工程师 Ryan Peterman 对话 TypeScript 之父 Anders Hejlsberg,谈及 TypeScript 编译器从 JavaScript 移植到 Go 的考量,反驳‘AI 将写完所有代码’等论调,指出主流语言地位会因 AI 更巩固,初级工程师不会被取代。
AI科技大本营
产品应用8
祝毅晨团队发布世界仿真器CurrentWorld - 0
Current Robotics团队发布交互式世界仿真器CurrentWorld - 0,创始人祝毅晨履历亮眼。该仿真器能跨本体、多视角、力 - 触觉预测,可用于评测机器人,还能让人类接管以探索不同动作结果。
量子位
产品应用7
Cherry Studio:从Chat到Agent的产品重构
Cherry Studio最初是为用户在不同大模型间切换的聊天客户端,随行业从Chat转向Agent,它开启2.0版本重构,定位转向「个人Agent平台」,底层架构重写,要解决产品复杂性、完善协作等问题。
Founder Park