开源动态8
MedAgentGym:让7B模型对标GPT - 4o
量子位
AI 摘要
埃默里大学等团队发布MedAgentGym,可提升大模型医疗代码生成和推理能力。实验显示,经其训练的Med - Copilot - 7B达GPT - 4o相当水平,还指明了模型性能提升方向。
阅读原文 · 量子位
7B模型对标GPT-4o,全球首个医疗代码生成大模型训练平台来了
研究团队发布全球首个医疗代码生成大模型训练平台MedAgentGym,提供评估基准和训练生态,提升大模型医疗代码生成与推理能力。经其训练的Med - Copilot - 7B达GPT - 4o相当水平,解决医疗AI编程瓶颈。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
京东健康AI医生「大为」撬动价值重估
京东健康AI医生「大为」让用户足不出户解决就医问题。财报显示其已覆盖超1000种病症,“618”服务用户数同比增近4倍,满意率超98%。它凭借数据、场景和履约能力实现问诊到服务落地,并探索长期健康管理。
机器之心
新闻资讯7
马斯克:AI直出二进制,大佬集体回怼
马斯克在X上称代码正变成下一个汇编,要让AI直接生成二进制,摒弃“源代码”。此言论引发争议,UML之父、《代码整洁之道》作者等教父级人物纷纷回怼,而现实中AI生成代码已成趋势。
新智元
新闻资讯7
Karpathy:Opus 5 10 美元造出中土 3D 世界
Andrej Karpathy 用 Opus 5 结合《指环王》开篇文字,花约 10 美元让其渲染 3D 游戏。Opus 5 两小时写出 5500 行代码生成 3D 世界,虽粗糙但证明 AI 强大。不过,LLM 无法高效审查自己工作,这是弱点。
新智元
开源动态7
Stripe测试:AI智能体校验环节有短板
Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。
InfoQ