「运行时契约」共找到 1173 篇相关文章
1/3预算跑平 GPT-5?上海AI Lab「路由魔法」成本直降63%性能反涨 7%!
当前大模型需解决性能与效率平衡问题,GPT - 5用测试时路由技术初步平衡。Avengers - Pro测试时路由框架集成不同LLMs,通过嵌入、聚类、评分操作,调整权衡参数α,能依查询特征选模型,性能和效率优于单一模型。
让64张卡像一张卡!浪潮信息发布新一代AI超节点,支持四大国产开源模型同时运行
浪潮信息发布新一代AI超节点“元脑SD200”,可让64张卡像一张卡。它支持四大国产开源模型同时运行,实现算力聚合突破,通过软硬协同优化提升推理性能,采用开放架构推动“智能平权”。
刚刚开源不到1MB大小,每个AI程序员都该装!
当跑多个 AI Agent 时,很难第一时间了解每个 AI 状态。刚开源的 `abtop` 项目运行在终端,能实时展示 Claude 和 Codex 会话状态,不依赖 API Key,功能实用且安装方便。
记录下SGLang 开发,编译和Profile的几个小技巧
作者记录在SGLang开源一年学到的开发和Profile技巧。包括解决perfetto可视化PyTorch Profiler结果时kernel丢失问题、PR切换分支方法,还介绍让SGLang无视版本运行以定位bug的方法。
微软的prompt压缩方案-LLMLingua,开源
使用大语言模型时,提示信息长会致运行慢、费用高、易超限。微软推出的LLMLingua可压缩提示信息,有完整开源。它历经多版本演进,还能用于安全防御,使用简单,值得开发者跟踪。
52KB 的奇迹!NovaSR 开源:16kHz 秒变 48kHz,快出天际的音频超分模型!
在AI“巨物崇拜”盛行时,NovaSR开源带来“微型震撼”。它仅52KB,能将16kHz音频提至48kHz,单张A100达3600倍实时。可端侧运行,效率提升显著,有诸多应用场景。
Talos Linux:为 Kubernetes 操作带来不可变性和安全性
Sidero Labs开发了专为运行Kubernetes的不可变操作系统Talos Linux及集群生命周期管理平台Omni。InfoQ采访Sidero团队,探讨其以极简和安全优先理念简化Kubernetes操作,还谈及产品战略、应用场景等。
GitHub 2.5万星!日本开发者打造的Hono火了:定义后React时代微框架的轻量未来
本周,Web 框架 Hono 在 X 官宣,GitHub 获 25000 星标。它由日本开发者 Yusuke Wada 于 2021 年创建,基于 Web 标准,可在多运行时运行,或指明后 React 时代 Web 框架方向。
谷歌Agent正在憋大招:AI科学家内测,锦标赛制“炼”想法,一次跑40分钟
谷歌正为Gemini Enterprise开发多智能体系统,能扮演联席科学家提炼想法,实现研究自动化。工作时以锦标赛形式评估想法,一次运行约40分钟,还准备了“想法生成”“联席科学家”等智能体。此外还有“与文档对话”功能。
构建一个 Agent 只要三分钟,但为什么大多数企业的 Agent 还停留在 Demo 阶段?
文章以 Google Cloud 开发者大会演示引出问题:构建 Agent 仅需几分钟,为何多数企业的 Agent 还停留在 Demo 阶段?指出这背后是治理、运行时等一连串工程挑战的叠加,还介绍了 Google Cloud 相关解决方案。