「推理工程」共找到 2742 篇相关文章
万字长文!大模型(LLM)推理优化技术总结(非常详细)
文章聚焦大模型推理优化技术,介绍推理过程分预填充与解码阶段,还阐述模型并行、注意力机制优化、模型优化及服务技术等,如多查询注意力减少内存,FlashAttention 优化计算顺序。
提示词工程、RAG之后,LangChain:上下文工程开始火了!
AI时代,上下文工程正兴起。它是构建动态系统,为LLM提供合适信息和工具以完成任务。随着应用复杂度增加,提供完整结构化上下文比提示词更重要,正成AI工程师重要技能。
品味 + 工程思维:AI 时代最难被替代的两件事
AI 时代,最难被替代的是做选择的品味和把结果做稳的工程思维。语法可交 AI,但需有工程思维,它能让使用者把 AI 用好,避免错误和复杂度失控。文章介绍了培养工程思维的方法。
大模型训练新突破!“不对称”训练让AI学会自我反思,推理零开销
字节团队提出全新语言模型训练方法PCL,首次打破训练与推理对称约束,实现‘训练-推理不对称’。在训练时让模型反思评估结果,推理时仅输出答案,零额外开销,显著提升模型能力。
更可靠的主播助理:淘宝主播Agent的Harness工程实战
文章聚焦淘宝主播Agent的Harness工程实战。介绍了Harness基础定义与分层结构,阐述上下文工程、工具调用等八项实战内容,还提及记忆体系特色,强调Harness工程是让主播Agent可用、可控、可演化的关键。
推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限
大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。
LLM 仅靠自身就能增强推理?SePT 给出简洁在线自训练范式
多数推理后训练方法依赖外部信号,SePT仅用模型自身生成的答案自训练,能提升推理能力,数学推理任务准确率升10个点。它核心简洁,设计关键是温度解耦等,不损模型通用能力,代码易迁移复现。
万字长谈丨同济工智院华先胜:工程智能,是 AI 的「成人礼」
雷峰网·AI科技评论对话同济工智院华先胜,探讨工程智能。他认为工程智能是AI与工程深度融合,要从数字走向物理世界,构建体系,实现人机共生,还介绍了研究院成果、灵感计算及操作系统架构等。
Andrej Karpathy 盛赞!斯坦福团队新作,让Llama-1B 实现毫秒级推理
斯坦福Hazy Research团队将开源模型Llama - 3.2 - 1B前向推理整合为“Megakernel”,把推理延迟大幅降低,显存带宽利用率显著提升。团队指出当前主流LLM推理系统在小batch、极低延迟场景下低效,提出Megakernel以重构执行方式。
妈妈再也不用担心延迟了!斯坦福手搓Llama超级内核,推理仅需0.00068秒
斯坦福Hazy实验室推出低延迟推理引擎「Megakernel」,将Llama - 1B前向传播融入单一GPU内核,H100上提速1.5倍,B200上每次推理仅0.00068秒,比vLLM快3.5倍。文章分析传统引擎问题并介绍Megakernel设计。