多工具推理」共找到 6799 篇相关文章

推荐文章7

性能最高提升7倍?探究大语言模型推理之缓存优化

文章探讨大语言模型推理缓存优化技术演进与未来展望,介绍了主流推理框架vLLM、SGLang,分析KV Cache、Paged Attention、Prefix Caching等技术的优化点,还提及LMCache、DeepSeek的缓存技术,最后提到MCP赋能可视化OLAP智能体应用。

阿里云开发者
开源动态8

找到啦,我们已上车,Github 27000+ star,研发团队必备开源工具项目,真丝滑!!!

Trivy是开源安全扫描工具,支持扫描容器镜像等目标,识别CVE漏洞等风险。它有6大突出功能,技术优势明显,还给出使用示例、应用场景,与传统工具对比优势显著,适用于全生命周期安全分析。

小华同学ai
推荐文章8

大模型推理加速全链路:内存管理、编译优化、量化与并行策略

本文整理自金煜阳博士在QCon大会分享。介绍大模型推理挑战,如规模增大、架构复杂。阐述算子优化、内存管理、量化、异构调度和并行优化方法,还介绍开源推理引擎赤兔在国产芯片的实践成果。

InfoQ
算法论文7

1899个MCP服务安全研究:7.2%存在漏洞,5.5%暗藏「工具投毒」

研究人员对1899个开源MCP服务器扫描,发现7.2%项目有漏洞、5.5%遭工具投毒。MCP虽成事实标准且发展好,但代码质量堪忧,传统安全工具难检测其风险,为生态敲响警钟。

AGI Hunt
推荐文章8

【万字长文】大模型训练推理和性能优化算法总结和实践

本文总结大模型落地的训练、推理和性能优化算法与实践,介绍语言模型发展,对比BERT、GPT等训练方式,分析生成式大模型问题,还阐述数据处理、推理优化及训练调优等内容,并给出不同场景技术选型建议。

阿里云开发者
产品应用7

Harness Monitor:当个 Agent 同时写代码时,如何看住质量

作者在有了 OpenAI 赞助的 Codex Pro 后,让个 Agent 同时在一个代码库工作。他开发的 Harness Monitor 从 Git 视角出发,解决 Agent 写代码时的质量问题,涉及观察、治理等方面能力。

phodal
算法论文8

纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究

剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。

量子位
8

右兔短视频去水印工具正式上线!

右兔去水印工具,一键解析全网短视频,无需广告,免费下载,支持高清原画质。

孔学长
开源动态7

英伟达力荐,小团队两个月开源一款「光速级」智能体推理引擎

智能体时代算力需求庞大,LightSeek Foundation 小团队 2 个月打造大模型推理引擎 TokenSpeed,有 TensorRT LLM 性能、vLLM 易用性,受英伟达力荐且已开源,为智能体负载提供近「光速级」推理能力。

机器之心
开源动态8

单机H200最快DeepSeek V3和R1推理系统优化秘籍

作者从开源技术分享角度,盘点SGLang对单机规模推理的大量工程优化技巧,涉及FP8 Block GEMM演进、FusedMoE模块优化、Attention Backend优化等,助于提升DeepSeek V3/R1在单机H200上的推理性能。

GiantPandaLLM