TensorRT-LLM」共找到 967 篇相关文章

算法论文8

LLM工业级自进化:北邮与腾讯AI Lab提出MoE-CL架构,解决大模型持续学习核心痛点

北邮百家AI团队与腾讯AILab提出MoE - CL架构用于LLM自进化持续指令微调。其结合‘解耦LoRA专家’与‘GAN对抗降噪’,在腾讯业务及基准测试中效果佳,降低人工成本,准确率优于主流方法。

机器之心
算法论文8

别再只关注KV Cache了! LLM稀疏性新洞察:为何模型越深越稀疏?UNCOMP从矩阵熵给出答案

团队论文UNCOMP获EMNLP 2025主会接收,它提出高效推理框架,从截断矩阵熵视角解释LLM深层稀疏现象。还能识别关键结构、找到最优压缩策略,设计的UNCOMP框架优化KV Cache,实验效果佳。

深度学习自然语言处理
8

中科院信工所发布首篇LLM智能体幻觉综述!梳理5类幻觉、18大诱因与10种缓解方案,300+论文资源开源

中科院信工所等机构团队发布首篇聚焦LLM智能体幻觉的综述,厘清其与传统语言幻觉区别,提出5类幻觉分类体系和18大触发原因,给出10种缓解策略,还开源300+论文库并指明未来研究方向。

深度学习自然语言处理
开源动态7

英伟达力荐,小团队两个月开源一款「光速级」智能体推理引擎

智能体时代算力需求庞大,LightSeek Foundation 小团队 2 个月打造大模型推理引擎 TokenSpeed,有 TensorRT LLM 性能、vLLM 易用性,受英伟达力荐且已开源,为智能体负载提供近「光速级」推理能力。

机器之心
开源动态7

一年后,DeepSeek-R1的每token成本降到了原来的1/32

几天前,DeepSeek更新R1论文至86页,公开训练全路径等细节。英伟达发表博客展示在Blackwell GPU上对其降本增效,通过软硬协同提升每瓦特Token吞吐量,还介绍了TensorRT - LLM软件及相关技术提升性能的情况。

机器之心
产品应用8

RecGPT-阿里的LLM推荐系统落地方案

文章介绍阿里RecGPT推荐系统落地方案,包括召回和推荐可解释性两方向。召回采用三塔结构,通过挖掘用户兴趣生成商品标签提升召回多样性。还提及行为序列压缩、推荐归因等,以及大模型微调和评估方法。

王喆的AI笔记
算法论文8

ICLR 2025 Oral | LLM也有从众心理!

浙江大学团队论文指出,多AI协作系统存在“群体思维”,多个AI共同决策时会盲目跟多数意见。研究者开发BenchForm测试平台验证LLM从众行为,还分析原因、给出让LLM更独立的方法,指出从众利弊及未来挑战。

深度学习自然语言处理
推荐文章7

万字长文!大模型LLM推理优化技术总结

文章围绕大模型LLM推理优化技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优化、模型优化和模型服务等技术,如Pipeline并行、MQA、量化、动态批处理等。

OpenMMLab
新闻资讯8

Open Responses 规范实现智能体式 LLM 工作流的统一

OpenAI发布Open Responses开放规范,获Hugging Face等支持,为智能体式AI工作流制定统一标准,减少API碎片化,支持多模态输入等,引发行业对厂商锁定和生态成熟度的讨论。

InfoQ
算法论文8

NVIDIA提出小型LLM才是未来,并将重塑Agentic AI

人工智能代理快速渗透企业场景,但当前系统依赖大型语言模型,存在经济成本和效率错配痛点。NVIDIA团队提出小型语言模型才是代理AI未来,论证其能力、经济性和操作适配性优势,并给出迁移路径。

深度学习自然语言处理