在离线混部」共找到 8177 篇相关文章

推荐文章8

大模型推理加速全链路:内存管理、编译优化、量化与并行策略

本文整理自金煜阳博士QCon大会分享。介绍大模型推理挑战,如规模增大、架构复杂。阐述算子优化、内存管理、量化、异构调度和并行优化方法,还介绍开源推理引擎赤兔国产芯片的实践成果。

InfoQ
算法论文8

GRPO训练不再「自嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化

GRPO视觉生成流模型后训练阶段有显著提升,但clip机制存系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,多种任务中表现良好。

机器之心
算法论文8

首个多轮LLM Router问世, Router-R1可让大模型学会「思考–路由–聚合」

大语言模型种类爆炸的时代,如何智能分配任务成新挑战。伊利诺伊大学香槟分校团队发布 Router - R1,让 LLM 学会‘思考–路由–聚合’,用强化学习平衡性能与成本,七大基准测试表现出色。

机器之心
算法论文8

Skills驱动推理新范式,清华&北大:Token立省59%,准确率不降反升

当前推理模型虽准确率高,但生成“思考过程”会使推理成本和延迟上升。奇元科技、清华、北大等提出TRS框架,将历史推理轨迹蒸馏成技能卡片,推理时检索注入,实现更少Token、更高准确率。

PaperAgent
8

我们测试了百度的「AI 科学家」,它正悄悄淘汰算法工程师

百度 2025 世界大会亮相的「伐谋」,是全球领先可商用自我演化超级智能体。它源于进化论,能让算法自我进化。实测显示其生活场景和复杂决策问题上表现优越,架构精巧,将推动算法研发普惠化。

特工宇宙
算法论文8

700万参数击败DeepSeek R1等,三星一人独作爆火,用递归颠覆大模型推理

今年6月Sapient Intelligence提出的HRM影响大模型推理结构,四个月后三星研究员Alexia Jolicoeur - Martineau推出TRM,700万参数模型推理基准测试中超越参数多10000倍的模型,还介绍了TRM原理、改进及实验结果。

机器之心
新闻资讯7

苹果的局面,很迷惑

作者对比 Google I/O 大会上谷歌的表现,认为苹果 WWDC 上的表现令人失望。苹果更新设计语言,其 AI 侧重端侧模型,有数据安全等优势,虽目前参数量小,但端侧 AI 或成新战场。

MacTalk
算法论文8

AI 终于学会 「自我坦白」!Anthropic最新论文震撼来袭,「内省适配器」让黑盒模型自己说出隐藏行为

2026年4月28日,Anthropic联合剑桥大学发布论文,提出“内省适配器”技术,可让大模型用自然语言“坦白”微调中学到的行为。该技术AuditBench基准测试等实战中表现出色,但也存高误报率等局限。

AI科技评论
算法论文8

无预训练模型拿下ARC-AGI榜三!Mamba作者用压缩原理挑战Scaling Law

CompressARC研究中,Mamba作者Albert Gu团队给出不同于大规模预训练的智能配方——最小描述长度(MDL)。一个76K参数、无预训练模型,ARC - AGI - 1基准解决20%问题,获ARC Prize 2025第三名。

量子位
开源动态8

微软GigaTIME登上《Cell》:5美元切片变成免疫图谱

微软GigaTIME登上《Cell》,能把5美元H&E切片翻译成稀缺免疫图谱,人群尺度重建TIME。它突破癌症免疫研究旧限制,成果经多数据集验证,已Foundry Labs与HuggingFace全量开源。

新智元