「置信解码」共找到 107 篇相关文章
微软深夜发布SambaY架构,Phi-4min加速10倍推理
微软基于Phi-4-mini版本,针对特定推理任务微调出Phi-4-mini-Flash-Reasoning 3B模型,将其扩展到200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行快10倍,有诸多优点。
动态RAG新工作:效果爆了,代码已开源
大语言模型幻觉问题突出,现有动态RAG方法信号不可靠。QuCo-RAG从预训练语料库挖掘统计证据,用客观频率替代主观置信度,实现毫秒级幻觉检测与动态检索触发,代码已开源。
MetaAI解锁Transformer潜意识,仅额外3%计算开销,性能提升最高55%
Meta FAIR研究员François Fleuret提出《The Free Transformer》,对解码器Transformer扩展。它通过引入随机变量,让模型先计划后执行,用约3%计算开销,在编程等任务上性能提升最高达55%。
产品经理必读:AI智能体架构指南——为什么能力强不等于用户爱用?
文章为产品经理打造AI智能体架构指南,以客服智能体为例,阐述四个架构层面决策,分析主流架构方法优劣,还指出构建智能体要注重信任策略,第二部分将探讨自主性决策和治理问题。
刚刚,英伟达新模型上线!4B推理狂飙53倍,全新注意力架构超越Mamba 2
Jet - Nemotron是英伟达推出的小模型系列(2B/4B),由全华人团队打造。其提出PostNAS与JetBlock,实现架构优化。相比Qwen3等模型,它在多维度准确率更高,H100 GPU上推理吞吐量最高提升53倍。
Meta提出Deep Think with Confidence:几乎啥都不用动,就能提升推理的准确性与效率
传统自一致性方法虽能提升推理准确率,但计算开销大、收益递减。Meta AI与UCSD团队提出Deep Think with Confidence(DeepConf),可在不增训练成本和不调超参数下,提升推理准确性与效率,本文对其全面解读。
AI热点选品:当推荐系统遇上“热点”,我们需要一场变革
文章指出当下推荐系统追踪热点滞后,存在时效、解码、迭代困境。为此启动热点AI选品项目,构建自动化热点响应系统,经多环节处理输出优质候选集,还介绍成果、后续优化方向及AIGC图像生成方案。
通用LLM压缩算法,居然藏视频编码里!2.5bit实现4bit性能,硬件无缝支持
LLM.265研究发现,视频编码器是高效的大模型张量编码器,现成视频编解码硬件压缩AI模型数据效率高。它灵活控制码率、可压缩多种张量,还能利用GPU硬件加速。实验显示其压缩效果显著。
弯道超车?国产具身,千小时人类数据激发智能涌现
近日,深度机智用人类学习范式在国际 Benchmark 上击败巨头,成果两会首日被央视报道。其全新架构源于一年多积累。英伟达也有人类学习尝试。深度机智构建全栈技术矩阵,成果显著,3 月底成果将开源。
中学生就能看懂:从零开始理解LLM内部原理【十三】|GPT 架构如何工作 ?
本文是对GPT架构工作原理的解读。介绍了GPT与Transformer的关系,阐述其从输入文本到预测下一词概率的流水线,详述训练和推理流程,还提及GPT架构进化的混合专家(MoE)模型。