编译优化」共找到 1272 篇相关文章

开源动态8

Sand.ai开源发布MagiCompiler:突破局部编译界限,定义训推性能上限

大模型开发者面临速度与显存的两难选择,原生torch.compile有局限。Sand.ai开源MagiCompiler,突破传统编译界限,提出Compiler as Manager理念,解决算力与显存墙难题,性能实测亮眼,且接入简单。

机器之心
7

记录下SGLang开发,优化,debug的技巧之大SKILL时代已来临

文章记录SGLang开发等技巧,介绍Agent在编程开发领域的强大能力,如完成多种工作、提升模型速度。还提及Agent流程优化方向,提醒警惕其偏差,指出人的价值转变,成为设计、把关和提炼者。

GiantPandaLLM
推荐文章7

拆解、对比与优化:LLM工具智能体的五种任务规划与执行模式

文章探讨了大语言模型驱动的AI智能体的五种任务规划与执行模式,包括ReAct、Plan-and-Execute、静态Workflow、Workflow+局部智能、模块化的分层规划,分析其优缺点、适用场景,还给出优化方法。

AI大模型应用实践
新闻资讯8

AICon 2025 深圳回顾:AI Agent 爆火全场,管理与推理优化成新焦点

2025年8月22 - 23日,AICon全球人工智能开发与应用大会在深圳落幕。70+嘉宾、800+开发者与企业代表参会,议题覆盖AI Agent、推理优化等。AI Agent成全场焦点,企业管理议题意外走红,展示了AI深入各领域的趋势。

AI前线
开源动态8

MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding

文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行时设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。

GiantPandaLLM
算法论文8

10步优化超越强化学习,仅需1条未标注数据!后训练强势破局

无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。

新智元
产品应用7

企业官网GEO优化:可直接复制JSON-LD+llms.txt模板(适配AI推荐)

文章提供企业官网GEO优化方案,含首页、FAQ页结构化代码及llms.txt模板,还有通用FAQ选题。介绍使用方法、上线校验步骤和生效判断标准,助企业适配AI推荐。

孔生SEO
算法论文8

不止于量化:最新综述用「时-空-构」三维视角解构KV Cache系统级优化

随着LLM向1M上下文演进,KV cache成推理服务效率核心瓶颈。墨尔本大学和华中科技大学研究者发布深度综述,用「时间 - 空间 - 结构」视角梳理KV cache优化方法,还归纳关键观察、提出开放挑战,并整理了资源库。

机器之心
开源动态8

3A大作!阿里ROLL团队从基建->算法->机理,推动RL4LLM全栈协同优化

阿里巴巴ROLL团队联合高校推出「3A」协同优化框架,推动「强化学习用于大语言模型(RL4LLM)」迈向新范式。Async架构提升GPU利用率,AsyPPO降低计算资源消耗,Attention机制提升训练效率与可解释性。

机器之心
推荐文章8

构建 AI 时代的知识底座:直播数据 LLM Wiki 实践

文章围绕直播数据 LLM Wiki 实践展开,指出领域知识沉淀面临挑战,引出 LLM Wiki。介绍其实际效果,如指标召回、代码生成等,阐述构建方法、架构设计、编译流水线、检索方式,还提及增量编译与持续 Lint,最后给出未来规划。

阿里云开发者