「高效推理框架」共找到 3696 篇相关文章
阶跃新模型快到“没推理”!印奇上任,果然气势一新
印奇上任后,阶跃星辰发布新一代开源Agent基座模型Step 3.5 Flash,总参数196B,支持256K上下文窗口。它推理快,适配多家芯片厂商,在多场景表现出色,还具备端云协同能力,架构也有多项优化。
成本仅0.3美元,耗时26分钟!CudaForge:颠覆性低成本CUDA优化框架
CUDA代码性能对模型训练与推理重要,但手动优化门槛高。明尼苏达大学团队提出CudaForge,是低成本多智能体CUDA Kernel生成与优化工作流,实验效果好,成本低且具通用性。
4B参数实现理解、推理、生成、编辑一体化!InternVL-U重磅开源
上海人工智能实验室联合多所高校开源多模态一体化模型 InternVL-U,仅 4B 参数,突破现有统一多模态模型瓶颈,在复杂场景超越 14B 级模型,已全面开源,提供推理代码等。
智能体时代的强化学习:AReaL 框架与 Agent 最佳实践
本文整理自吴翼博士在 2025 年 QCon 全球软件开发大会的分享。他介绍 AReaL 框架及 Agent 最佳实践,阐述强化学习与大模型联系,指出 Agent 是 AGI 未来 5 年关键,强化学习是 Agent 技术核心,还分享团队成果与经验。
首个MCP架构、只50行代码就能实现高效RAG的开源框架UltraRAG 2.0
检索增强生成系统(RAG)复杂度提升,使科研人员面临高昂工程实现成本。清华大学、东北大学、OpenBMB等联合推出UltraRAG 2.0,基于MCP架构,降低技术门槛与学习成本,让科研专注创新。
腾讯Kuikly框架鸿蒙版正式开源 —— 揭秘卓越性能适配之旅
腾讯将广泛使用的跨端开发框架Kuikly鸿蒙版正式开源,已接入多款业务。它有高性能、动态化特点,适配中解决渲染、文本性能等问题,还优化调试效率,发布Compose DSL Beta版。
CVPR 2025 | 解决XR算力瓶颈,FovealSeg框架实现毫秒级IOI分割
来自纽约大学和Meta Reality Labs的联合研究提出Foveated Instance Segmentation新方法。FovealSeg框架结合眼动追踪,能解决XR算力瓶颈,实现毫秒级IOI分割,在多数据集测试中速度与精度双赢。
NeurIPS2025 Spotlight | RobustMerge: 多模态大模型高效微调模型合并的全新范式
中科院、中山大学、北大团队针对高效微调模型合并难题,提出「方向鲁棒性」概念,揭示 PEFT 模块合并失败主因,给出 RobustMerge 解决方案,提升性能,成果开源。
国内首次!8.9毫秒推理速度破纪录,1元打穿百万token
在2025人工智能计算大会上,浪潮信息发布元脑SD200和元脑HC1000两款AI服务器。前者让DeepSeek R1的Token生成速度达8.9毫秒,后者将推理成本降至1元/百万Token,解决了AI智能体速度与成本难题。
扩散LLM推理新范式:打破生成长度限制,实现动态自适应调节
随着扩散大语言模型成为热门,但其推理时存在预设固定长度的限制。香港中文大学 MMLab 等提出 DAEDAL,赋予模型根据问题自主调整回答长度的能力,在性能和计算效率上有提升。