性能优化」共找到 2824 篇相关文章

算法论文8

对抗KV Cache压缩的脆弱性:两行代码以最坏风险控制防御底层假设崩塌

中科大团队在 ICLR 2026 论文中指出 KV Cache 压缩领域底层假设存在缺陷,主流方法基于的稳定性假设在真实场景中脆弱。团队提出防御性聚合策略,仅两行代码修改,显著提升 KV Cache 压缩性能

机器之心
开源动态8

Qwen3-ASR的MLX原生实现:让SOTA语音识别跑满苹果芯片

Qwen3 - ASR是强大开源语音识别模型,但官方实现无法充分利用苹果芯片GPU能力。开发者完成MLX重写,让其能在苹果芯片上原生运行,实测性能佳,还有诸多核心功能及安装使用示例。

AI工程化
开源动态8

公开模型一切,优于DeepSeek-R1,英伟达开源Llama-Nemotron家族

英伟达推出面向高效推理的 Llama-Nemotron 系列模型,包括 Nano、Super、Ultra 等规模,具备卓越推理能力与效率,采用开放许可。模型支持动态推理切换,训练结合多方法,性能优于 DeepSeek-R1 等。

机器之心
产品应用8

硬件成本直降60%!原生分布式VS传统分库分表数据库

服务器硬件价格上涨,传统分库分表架构资源利用效率低。OceanBase 作为原生分布式数据库,通过多种技术优化资源,降低硬件依赖,多个案例显示其能大幅降低成本、提升性能,获 Forrester 认证。

InfoQ
新闻资讯8

刚刚,OpenAI 发布 GPT‑5-Codex 新模型,专为编程而生

OpenAI 发布专为 Agent 编程优化的 GPT-5-Codex 新模型,在动态思考、性能、代码审查等方面表现出色。同时,Codex 平台大升级,集成 GitHub,保障安全隐私,还公布了定价与可用性。

AGI Hunt
新闻资讯7

92% 工程师都在用 AI 后,Uber 开始给 AI “限额”了

Uber的‘零增长技术栈’解耦容量与业务需求,优化Go运行时性能。还将生成式AI集成开发,92%工程师在用,但成本压力大。为此,Uber限额每位开发者,审查代码效果,完善评估指标。

InfoQ
开源动态8

斩获5.4K star!发现一款轻量快速开源利器,支持插件和主题,非常6!

开源君介绍轻量级文本编辑器`Lite XL`,它用 Lua 编写,基于「lite」优化,安装包仅几 MB,能在多系统流畅运行。其性能出色,还支持插件和主题定制,适合资源有限设备。

开源先锋
开源动态8

FlashAttention-4正式发布:算法流水线大改,矩阵乘法级速度

深度学习领域底层优化技术FlashAttention更新至4版本。其核心作者称在Blackwell GPU上,注意力机制执行速度接近矩阵乘法。新算法克服瓶颈,在B200上性能提升,还获Pytorch官方支持。

机器之心
产品应用8

nndeploy:一款基于可视化工作流的AI部署工具

nndeploy是简单易用且高性能的AI部署框架,可将推理优化转化为可视化工作流,无需前端技术栈。它还提供端侧完整AI部署方案,有多端推理等功能,介绍了使用方法与技术原理。

GiantPandaLLM
开源动态7

Agent能自己“复盘”和“进化”,这个开源框架牛了!

文章介绍了自进化AI,其核心是执行、评估、进化的反馈循环,能自动修改Prompt和工作流。还讲解了SEW、TextGrad等优化器原理,并以SEW为例展示逻辑,最后推荐开源框架EvoAgentX。

探索AGI