Attention性能瓶颈」共找到 2427 篇相关文章

开源动态8

9B“小”模型干了票“大”的:性能超8倍参数模型,拿下23项SOTA | 智谱开源

智谱发布并开源仅9B大小的模型GLM-4.1V-9B-Thinking,在28项评测中拿下23个SOTA,成10B级别最佳VLM模型。它引入思维链推理机制,通过课程采样强化学习提升能力,还获10亿投资。

量子位
算法论文8

何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升

何恺明最新论文研究扩散模型与表征学习的联系,提出Dispersive Loss正则化方法。它无需正样本对,有高通用性、低计算开销等优势,在多模型测试中提升了生成质量,在其他任务也有潜力。

量子位
开源动态8

社区供稿丨35B参数科学性能比肩万亿参数模型,『书生』科学大模型Intern-S2-Preview开源

5月15日,上海AI实验室开源新一代大模型预览版Intern - S2 - Preview,参数35B,多领域比肩万亿参数模型。它深化与昇腾算力生态协同,探索‘通专融合’,强化科学及智能体能力,‘算法 - 系统 - 算力’协同提升训推效率。

Hugging Face
新闻资讯7

抨击 AI 炒作、曝企业需求为先,Anthropic 联创:模型提 0.01 性能就血赚,算力烧钱但值!

Anthropic 由 7 位前 OpenAI 核心成员创立,联合创始人兼总裁 Daniela Amodei 在接受采访时表示,“AI 安全”是核心优势,企业客户对安全性的高要求与之匹配。Anthropic 以“不要相信炒作”为价值观,谨慎对待支出和算法效率。

InfoQ
算法论文8

GUI定位还在玩「非黑即白」?浙大团队提出GUI-G²,显著提升GUI智能体定位性能

在人工智能领域,GUI 智能体成技术风口,但现有 GUI Grounding 方法有缺陷。浙大团队提出 GUI - G²,将 GUI 交互转变为连续空间建模,在三个主流 GUI 定位基准测试中表现亮眼,重新定义了 GUI 交互本质。

机器之心
开源动态8

4B小模型数学推理首超Claude 4,700步RL训练逼近235B性能 | 港大&字节Seed&复旦

香港大学NLP团队联合字节跳动Seed、复旦大学发布Polaris强化学习训练配方,让4B模型数学推理能力超商业大模型,且Polaris-4B可在消费级显卡部署,相关内容已全部开源。

量子位
算法论文8

CVPR 2026|突破3D空间推理瓶颈:北大联合南科大提出QuatRoPE,让大模型精准理解三维物体关系

北大联合南科大团队提出全新 3D 位置嵌入方法 QuatRoPE,改善大语言模型 3D 空间推理痛点。还提出 IGRE 降低干扰,构建 ASR 基准评估能力。研究被 CVPR 2026 接收,代码与模型已开源。

机器之心
新闻资讯8

GTC 巅峰对话 Jeff Dean x Bill Dally:预训练范式已死、延迟瓶颈不在计算、谈透 AI 五年未来 | GTC 2026

GTC 2026上,NVIDIA首席科学家Bill Dally和Google Jeff Dean展开重磅对话。讨论了模型能力进步、低延迟推理架构、模型自主进化、数据与算力、训练与推理硬件差别等多方面内容,分享对未来AI的看法与见解。

AI科技大本营
算法论文8

ICSE 2026杰出论文 | 突破代码模型真实工程落地瓶颈,北大团队提出SEAlign对齐框架:显著提升软件工程智能体决策质量

现有代码模型在经典基准表现好,但在真实软件工程环境表现差。北大金芝、李戈团队提出 SEAlign 框架,通过识别与对齐智能体轨迹关键决策点,提升模型在真实工程任务表现,成果获 ICSE 2026 杰出论文奖。

机器之心
算法论文8

小模型用不好Skill?新范式让模型学会Skill的底层逻辑,3B模型推理token省5倍,性能反超

浙江大学联合美团龙猫团队、清华大学推出SKILL0,提出技能内化思路。它在训练中引入关键机制,让小模型把技能内化到参数里。实验显示,其效果出色,token效率高,为小模型成领域专家提供新方向。

量子位