「生产级部署」共找到 1763 篇相关文章
重塑AI记忆边界:MemOS开源!时序推理较OpenAI提升159%
近日,记忆张量等多家团队发布面向大模型的工业级记忆操作系统MemOS。它借鉴传统操作系统架构,实现AI记忆结构化管理,性能超OpenAI等方案,未来将成立社区、推进应用及持续迭代。
“英伟达显卡就是一坨*”!博主6000字檄文怒批:烧接口、缺单元、驱动变砖还威胁媒体
博主Sebin发布近6000字檄文批判英伟达,指出其显卡有烧接口、缺单元、驱动变砖等质量问题,销售策略存在库存少、黄牛多、捆绑销售等问题,还试图操控媒体及评测机构。文章在Hacker News引发大量讨论。
AI 编程如何在团队中真正落地?
文章围绕AI编程工具Cursor在团队落地展开。分析推广难题,如使用意愿和能力问题,提出研发流程规范、结构化语言表达和应用级特化解决方案,还给出通用Rules和prompt示例,助力Cursor高效落地。
程序员必收藏!AutoGPT x 167k star实战指南:AI拆解+插件驱动,源代码一键自动化
AutoGPT 是基于 GPT - 4 的开源自主智能代理,在 GitHub 上超 176K 星,速度超 PyTorch。它能解决复杂任务自动化等痛点,具备持续自动任务等核心功能,还给出使用指南,在同类型项目中领先。
Gödel Rescheduler:适用于云原生系统的全局最优重调度框架
本文介绍字节跳动研发的Gödel Rescheduler重调度框架,它能解决传统调度资源分配和任务摆放问题。阐述传统重调度弊端,介绍新方案组件,列举应用场景及成果,还提及未来规划,目前已开源。
豆包 1.6发布后,我用火山引擎Trae + MCP,仅半天做了一个“秒懂科研”的PaperAgent!
文章介绍用火山引擎Trae + MCP和豆包1.6构建“秒懂科研”的PaperAgent。对比其与传统开发范式,突出前者高效、低成本优势,还展示了PaperAgent技术栈及开发过程,体现AI云原生开发魅力。
vLLM Ascend超越MindIE? 昇腾推理Qwen3与DeepSeek R1 Distill性能实测
国内开发者在昇腾NPU上进行大模型推理面临挑战,华为MindIE推理引擎使用门槛高。昇腾联合vLLM社区推出vLLM Ascend插件。本文用GPUStack平台实测其与MindIE性能差异,得出两者在不同场景各有优势的结论。
开源黑科技!向量数据库,居然要被 MP4 给干掉了!
GitHub开源项目Memvid,能用MP4视频文件替代昂贵的向量数据库,检索达亚秒级。它把文本编码成视频,用配套JSON索引记录位置,结合sentence-transformers和FAISS实现语义搜索,存储和检索性能出色。
大模型微调知识与实践分享
文章详细介绍大型语言模型(LLM)微调知识与实践,包括模型结构、参数量等知识,以及Prompt工程、数据构造、LoRA微调等技术点。还给出微调实践流程,介绍相关平台和框架,如星云、TuningFactory等。
告别卡脖子,华为黑科技破局!昇腾推理加速1.6倍打破LLM降智魔咒
大模型参数规模大,推理部署难。华为诺亚提出Pangu Light框架,结合算法创新与国产昇腾平台,通过跨层注意力剪枝等技术,解决剪枝后模型失稳问题,实现高压缩率、推理加速与高精度。