医学基准」共找到 927 篇相关文章

算法论文8

你写的Skill,正在拖慢模型?策略式Gene才是正确答案

EvoMap团队与清华围绕‘Skill拖慢模型’问题研究,提出‘Gene’概念。经实验,Gene在控制模型表现上优于Skill,还定义了GEP协议。其成果在CritPt基准测试表现出色,为Agent经验复用提供新方向。

机器之心
新闻资讯7

Meta亿元天团首个大模型交卷!余家辉宋飏Jason Wei耗时九个月,一雪Llama前耻

Meta超级智能实验室耗时9个月推出原生多模态模型Muse Spark,发布后股价拉升。它让Meta在第三方测评中赶上第一梯队,虽在编程和长时间自主运行有差距,但在多模态理解等方面表现突出,不过也有编程翻车情况。

量子位
新闻资讯8

Anthropic 训出史上最强模型,当场决定不发布

Anthropic推出Claude Mythos Preview模型却不对外开放。该模型在多维度基准测试中领先,还能发现大量网络安全漏洞。系统卡记录其不良行为,Anthropic推出Project Glasswing应对,认为现有对齐方法或难约束下一代系统。

AGI Hunt
新闻资讯8

姚顺宇谷歌首秀,Gemini新模型刷爆SOTA:人类仅剩7人捍卫碳基编程

面对Claude Opus 4.6和GPT Codex 5.3的攻势,谷歌升级Gemini 3 Deep Think,在多项基准测试刷爆SOTA,推理成本降低82%。它还走进科研工程领域,其研发团队有不少华人,如姚顺宇、Yi Tay。

量子位
新闻资讯8

刚刚Gemini上新模型,全球只有7人比它会编程,谷歌姚顺宇参与

北京时间周五凌晨,谷歌发布Gemini 3 Deep Think重大升级,在多学术基准测试中取得佳绩,成本大幅降低,编程能力超多数人。在多科学领域表现出色,还推动了实际应用,已上线供部分用户使用。

机器之心
算法论文8

AI看图一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华

随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’机制让模型‘看全又准’,实验效果显著。

量子位
算法论文8

西湖大学提出RDPO强化学习框架,实现扩散模型并行推理加速

扩散模型“顺序去噪”特性成速度提升瓶颈。西湖大学AGI Lab提出RDPO框架,不必改动模型本身,优化其“采样导航系统”,在多基准测试中取得领先图像生成效果,解决加速问题并提供RLHF对齐新范式。

量子位
算法论文8

谷歌DeepMind团队新框架:让AI告别每次从头开始,在任务流中越用越聪明

谷歌DeepMind团队联合伊利诺伊大学提出Evo-Memory框架和ReMem架构,改变大模型只能被动检索历史的现状,让智能体实现终身学习。通过基准测试验证其有效性,实验显示ReMem优势明显,还揭示记忆复用关键因素。

AIGC开放社区
开源动态8

国产AI拿下国际物理奥赛金牌,13项顶级竞赛豪取12金1银,划重点:开源

上海人工智能实验室团队推出开源模型家族P1,在IPhO 2025理论考试中,P1-235B-A22B成首个达金牌线的开源模型。引入PhysicsMinions后成绩提升,在HiPhO基准排名第一,且全链路开源。

量子位
产品应用8

DeepSeek-V3.2-Exp:用稀疏注意力打破长文本效率瓶颈

在NLP领域,处理长文本时传统注意力机制效率低。DeepSeek团队推出DeepSeek-V3.2-Exp模型,引入稀疏注意力机制,在保持性能同时提高长文本处理效率,降低计算复杂度,在多基准测试中表现良好。

CourseAI