全栈优化」共找到 3006 篇相关文章

开源动态8

腾讯太极团队实现DeepSeek模型业内H20最高性能15800+ tokens/s

腾讯太极团队揭秘实现DeepSeek模型15800+ tokens/s业内H20最高性能的方法,通过PD分离、多层MTP优化全栈优化方法论,还介绍多机性能优化方案,后续预计性能突破20000 tokens/s。

腾讯技术工程
推荐文章8

小红书 FinOps 实践:云成本优化与资源效率提升之道

在 InfoQ 举办的 QCon 球软件开发大会上,小红书梁啟成分享云成本优化实践。介绍了小红书用云情况,分析成本优化面临的问题,阐述成本洞察和优化的探索,如内外账分离、CPU 和 GPU 资源提效等,还展望了 AI for FinOps 实践。

InfoQ
推荐文章8

Thinking Machines又发高质量博客:力推LoRA,不输量微调

Thinking Machines 博客力推 LoRA 并与量微调对比。研究发现小数据量任务中 LoRA 与量微调效果接近,大数据量稍吃力,强化学习中低秩 LoRA 也能接近量微调。还揭示了 LoRA 关键要素、超参数规律等。

机器之心
推荐文章8

AI Infra进入自进化时代!清华团队用「AI优化AI」造就国产万亿Token工厂

AI自主优化RSI成新焦点,被视为通往AGI的关键路径。硅谷为此沸腾,中国也不落后。清昴智能由清华团队创立,率先打造自进化算力底座,还基于国产算力打造万亿Token工厂,目标是让优化成为持续运行的基础能力。

量子位
产品应用8

腾讯混元AI Infra如何优化Hy3 Preview:一次大模型推理性能提升的技术拆解

文章聚焦腾讯混元AI Infra对Hy3 preview模型的推理性能优化。从算子优化与融合、并行策略等五大维度,剖析技术思路、算法及收益,如Attention算子单batch长文本最高加速2.95x,还提及后续显存优化等工作。

腾讯技术工程
新闻资讯8

谷歌AGI底座降临!首个原生模态嵌入模型上线,已实现模态SOTA

谷歌发布首个原生模态 Embedding 模型 Gemini Embedding 2,将文本、图、音视频及 PDF 融于统一向量空间,实现跨模态检索,降低架构成本,赋予 AI 连贯「记忆」,是重塑 AI 基建的里程碑。

新智元
算法论文8

NeurIPS 2025|CAKE:大模型驱动的贝叶斯优化新配方,让黑箱优化更智能、更高效

香港中文大学(深圳)等高校研究人员提出 CAKE 方法,被 NeurIPS 2025 接收。它利用大语言模型动态设计高斯过程核函数,构建自适应贝叶斯优化框架,在多领域实验中效果优,还具备可解释性。

机器之心
推荐文章7

海外GEO优化怎么做?15步可操作方法分享【干货】

白杨SEO分享海外英文GEO优化15步可操作方法。先阐述GEO与SEO、国内与海外GEO区别,后从高频词内容调研、发布原创数据等方面详细介绍优化步骤,还提及相关工具与平台。

白杨SEO优化教程
9

苹果应用商店ASO优化:Today、热搜、专题、内购、预定优化介绍(进阶篇五)

ASO进阶篇第五章深入探讨了苹果App Store中Today、热搜、专题、内购和预定等曝光位的优化策略,旨在帮助应用开发者提升App的曝光率和下载量。

孔学长
新闻资讯7

HF Papers 直播 AI Insight Talk| Omni模态专场

由多平台联合发起的【AI Insight Talk】系列直播活动第五场 - Omni模态大模型专场于2025年11月18日10:00 - 12:00直播。多位模态模型核心研发者将分享技术,还有圆桌对谈。

Hugging Face