动态专家调度」共找到 975 篇相关文章

算法论文8

一种基于滑动层合并的高效深度修剪大模型的方法

文章指出深度修剪可加快推理速度,但直接丢层会降低性能。为此提出滑动层合并法,根据相似度阈值融合连续层,简化结构且保持性能。实验显示该方法优于现有技术,还揭示了与宽度修剪结合的潜力。

机器学习AI算法工程
产品应用7

南京艺术学院人工智能与计算机视觉算法创新设计成果展示

南京艺术学院‘人工智能与计算机视觉算法创新设计工作坊’汇集师生与专家成果,涵盖多种艺术形式。学生学习多技术完成跨媒体作品,如以《大闹天宫》为蓝本的交互装置,还有探索情绪、文化等主题的作品。

MANA新媒体艺术站
8

国产AI眼镜现状,这里有份沙龙实录|量子位AI沙龙

量子位举办AI眼镜沙龙,小米、百度等专家指出行业关键挑战刚开始。如续航与常在线矛盾,国内厂商易走错路等。还探讨了技术方案、未来趋势、应用场景等,也有圆桌对话分享挑战与机遇。

量子位
产品应用7

数据「熵增」时代,AI 如何以标准重构治理秩序?

Agent热潮下数据分析与治理有短板,Gartner预测到2027年多数数据治理举措或失效。瓴羊Dataphin高级技术专家周鑫阐述以数据标准为核心的数据治理方法论及AI赋能自动化治理实践路径。

InfoQ
新闻资讯7

AI Infra 工程师们如何应对大模型流水线里的“暗涌”?

InfoQ《极客有约》X AICon 直播邀请华为、蚂蚁集团等专家探讨大模型 Infra 工程师实战日常。涉及大模型工程高频问题、版本迭代冲突处理、推理部署成本优化、开源项目挑战及 GPU 虚拟化趋势等内容。

AI前线
推荐文章7

AI Infra 工程师们如何应对大模型流水线里的“暗涌”?

InfoQ《极客有约》X AICon 直播,邀请华为昇腾专家 ZOMI 酱、蚂蚁集团马介悦和 SGLang 尹良升探讨大模型 Infra 工程师实战日常。涉及大模型工程高频问题、版本迭代策略、推理部署优化、开源项目挑战等内容。

InfoQ
推荐文章8

万字长文!大模型(LLM)推理优化技术总结(非常详细)

文章聚焦大模型推理优化技术,介绍推理过程分预填充与解码阶段,还阐述模型并行、注意力机制优化、模型优化及服务技术等,如多查询注意力减少内存,FlashAttention 优化计算顺序。

AINLPer
开源动态8

突破传统检索瓶颈!阿里通义实验室发布 WebDancer,开启多步推理智能体新范式!

在信息爆炸时代,传统检索技术缺乏动态决策能力,难以满足多步推理需求。阿里通义实验室发布的 WebDancer 基于 ReAct 框架,通过四阶段构建,在测试中表现优异,未来规划拓展工具生态、突破任务边界等。

开源星探
算法论文7

ACL2025 | 抓出0.1%的捣乱分子压缩方法OTT:近乎无损 超越KIVI,内存减6.4倍 吞吐量提2.3倍

LLM生成文本时KV Cache内存占用高,限制模型批量处理能力。论文提出OTT方法,动态追踪异常令牌单独高精度保存,其余压缩。实验显示,它准确性高、效率好,不过在极短文本等场景有局限。

深度学习自然语言处理
算法论文7

低延迟、高吞吐,LLM优化与高效推理引擎综述

LLM计算成本高,用户要低延迟,企业要高吞吐。工程师开发优化技术,如动态批处理、KV缓存、模型量化。论文对比25款推理引擎,还探讨了多模态支持、手机端推理、新型架构支持等进化方向。

深度学习自然语言处理