「推理性能优化」共找到 4208 篇相关文章
LLM的RL训练轨迹竟然是线性的?Miaow Lab|新工作:无需继续训练,直接“预测”未来模型!
文章介绍《Not All Steps are Informative: On the Linearity of LLMs' RLVR Training》,揭示RLVR训练中LLM权重和输出概率线性变化,提出“权重外推”法,可实现6.1倍训练加速,还介绍三种策略及实验结果。
AI编程真面目:完整项目通过率仅27% | 上交大新基准
多校联合团队发布ProjDevBench,评估AI编程智能体端到端项目开发能力。结果显示,六种主流智能体总体提交AC率仅27.38%,从零构建任务中性能大幅下滑,还揭示了智能体多方面短板。
Clawdbot国产芯片适配完成!清华特奖出手,开源框架直接一键部署
Clawdbot(现名OpenClaw)超火,不到一周GitHub达12万Star。但使用成本高,新开源的国产框架玄武CLI可让其在本地运行,适配国产芯片,还能降低成本,避免信息泄露。
劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束
谷歌发布世界模型原型 Project Genie,用一句话或图就能生成可玩交互的实时虚拟世界,由劈柴哥和哈萨比斯站台。它基于 Genie 3、Nano Banana Pro 和 Gemini 构建,解决了世界模型长期以来的短板,目前处于实验阶段。
VLM剪枝新SOTA:无需重训练,注意力去偏置超越6大主流方案
常用的attention机制存在位置偏置和padding异常,影响剪枝效果。上海大学曾丹团队提出无需重新训练的attention去偏方法,在多模型、剪枝策略及基准上验证有效,为多模态模型部署提供新思路。
大模型的第一性原理:(二)信号处理篇
本文从信号处理角度解读大模型原论文,探讨语义向量化原理,分析 Transformer 与 Granger 因果关系。指出大模型输入 Token 语义嵌入是将自然语言处理转化为信号处理问题,向量化与信号处理、信息论联系紧密。
解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南
给多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。
刚刚,谷歌DeepMind登Nature封面!人类40亿年生命代码「开源」了
谷歌AlphaGenome登上Nature封面,可一次性「读入」100万个DNA碱基对,对数千种分子特性高度预测。它已在GitHub开源,诺奖得主称未来十年AI将治愈所有疾病,其重构了生命科学底层逻辑。
企业级 AI Agent 的终极王牌:从 0 到 1 带你理解 “本体论” 与 6 块核心“积木”。
文章指出大部分企业Agent项目因幻觉、跑偏等问题失败,引出基于“本体论”的企业“本体”工程。介绍企业AI困境、现有工程手段不足,阐述本体可补企业“语义层”及构建本体的6块核心“积木”。
拒绝Reward Hacking!港科联合快手可灵提出高效强化学习后训练扩散模型新范式
使用强化学习微调扩散模型时,常面临Reward Hacking和KL正则化阻碍探索收敛的问题。港科等团队提出GARDO框架,通过门控自适应正则化和多样性感知优化,解决痛点且全面开源。