「大模型推理加速」共找到 8576 篇相关文章
The Batch: 871 | Mistral测量了大语言模型的能耗、水耗与物料消耗
法国AI公司Mistral发布对Mistral Large 2的环境分析报告,涵盖全生命周期影响。研究表明单次使用影响小,但累计负担大。虽研究有不足,但其方法或推动环保型AI发展。
RAG效果不佳?先别急着微调模型,这几个关键节点才是优化重点
文章深入探讨RAG技术实现与优化,指出其在AI应用开发中常被当黑盒,从文档分块、索引增强、编码、混合检索到重排序等关键环节解析,强调结合场景调优以提升召回与精确率。
Agentic Deep Research新范式,推理能力再突破,可信度增加,蚂蚁安全团队出品
尽管LLM能力提升,但在复杂任务上受静态内部知识限制。业界提出Agentic Deep Research系统,不过现存系统有梯度冲突和奖励稀疏问题。蚂蚁安全团队提出Atom - Searcher,解决上述问题,实验效果良好。
无需CUDA代码给H100加速33%-50%,Flash Attention作者新作火了
Flash Attention、Mamba作者之一Tri Dao与普林斯顿博士生提出QuACK库,用Python写,无需CUDA C++。在H100上比优化库快33%-50%,吸引英伟达、PyTorch团队关注。还给出优化torch.compile建议。
ICCV 2025 | UniOcc: 自动驾驶占用预测与推理统一数据集及基准平台
来自多所高校团队在ICCV 2025发表统一基准框架UniOcc,融合多源数据,有体素级运动流标注等创新,提出免真值评估指标,支持协同预测,已开源,能推动自动驾驶迈向新阶段。
华为CloudMatrix重磅论文披露AI数据中心新范式,推理效率超NV H100
华为发布60页重磅论文,提出下一代AI数据中心架构Huawei CloudMatrix及产品CloudMatrix384。它架构设计独特,性能高效准确灵活,打破算力、延迟和成本“不可能三角”,重新定义AI基础设施。
微软开源多智能体自定义自动化工作流系统,加速搭建基于AI的自动化系统
微软开源多智能体自定义自动化工作流系统,可助企业用AI智能体实现复杂组织任务自动化。该方案整合多项Azure服务构建管道,有聚焦核心价值等功能,还给出部署指南与成本估算。
大模型从“胡说八道”升级为“超级舔狗”,网友:再进化就该上班了
AI开始研究Physical AI:FSD级团队亮出首版模型Simate-beta,空降RoboDojo
本文介绍成立仅三个月的Simate公司,核心团队曾打造对标特斯拉FSD的智驾系统,现已推出首版通用物理快系统Simate-beta,登顶RoboDojo,采用AI-native自动化体系研发Physical AI,已开启AutoResearch平台内测,完成多轮数亿元融资。
大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26
vivo AI Lab团队针对自动手语翻译生成中,无视觉证据支撑的错误累积导致语义偏移的痛点,提出置信度感知策略优化方法CAPO-SLT,仅调整强化学习更新规则,不修改主干网络,在中文手语翻译测试中拿下三项指标最高分,成果将发表于EMNLP'26。