「全注意力模型」共找到 8811 篇相关文章
陶哲轩回应OpenAI宣称内部实验模型获得IMO金牌:不予置评「测试方法不公开就是“作弊”?」
OpenAI宣称内部实验模型获IMO2025金牌,陶哲轩呼吁对AI竞赛表现保持审慎。他强调评估AI不能只看结果,测试方法很重要,对未公开测试方法的自我报告成绩不予置评。
比传统方法强7倍:Anthropic物理隔离危险知识,重塑大模型安全训练范式
Anthropic团队提出选择性梯度掩码技术(SGTM),在训练阶段将危险知识物理隔离到特定参数并剔除,实现安全性与通用能力更好平衡,抗恢复性是传统方法7倍,还能处理未标记危险数据。
NeurIPS 2025 | Code Graph Model:重塑代码大模型架构,利用“代码图”突破仓库级编程瓶颈
在 NeurIPS 2025 上,蚂蚁全模态代码算法团队展示「Code Graph Model (CGM)」,它将代码库图结构注入 LLM 底层注意力机制,打破业界刻板印象,在权威榜单上表现出色。文章解析其架构、训练策略和配套框架。
阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源
阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。
TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的
该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。
2025 IMO真题撕碎AI数学神话,全球顶尖模型齐翻车!冠军铜牌都拿不到
2025 IMO数学竞赛中,全球顶尖AI模型均翻车。冠军Gemini 2.5 Pro仅得31分,连铜牌都拿不到。Grok - 4表现糟糕,DeepSeek - R1也令人失望。AI虽有思路,但逻辑细节不足,离成奥数大师尚远。
定义RAG新基准?谷歌发布 Gemini Embedding 2:首个原生多模态嵌入模型,延迟骤降70%
谷歌昨夜推出首个基于 Gemini 架构的原生多模态嵌入模型 Gemini Embedding 2,通过 Gemini API 和 Vertex AI 向开发者公开预览。它可将多类型数据映射到统一嵌入空间,多项基测排名第一,还获早期合作伙伴高度评价。
Grok 4刷新ARC-AGI-2纪录:15.9%碾压所有公开模型,我们离AGI还有多远?
xAI的Grok 4在ARC-AGI-2测试中获15.9%,成全球最强公开AI模型。ARC Prize主席还原测试过程,虽成绩亮眼,但网友有质疑,且离人类表现差距大。Grok 4在多基准测试领先,定价便宜。
AAAI 2026 Oral | 拒绝「一刀切」!AdaMCoT:让大模型学会「看题下菜碟」,动态选择最佳思考语言
多语言大模型面临语言选择难题,现有跨语言推理方法存在缺陷。新加坡研究团队推出AdaMCoT框架,通过自适应路由机制动态选语言推理,提升跨语言事实推理准确性与一致性,效果超越传统方法。
刚刚,奥特曼发布GPT-5!人人免费用「博士级」智能,基准图错误遭全网吐槽
OpenAI 发布 GPT - 5,奥特曼连发推文介绍看点。它是集成模型,有免费版、Plus 和 Pro 计划,多领域跑分亮眼。不过直播现小 bug,跑分图出错,马斯克拆台,表现未达部分人预期。