「专家调度器」共找到 854 篇相关文章
IDC 最新AI Infra报告解读|AI 云爆发的背后:AI 应用全球化势不可挡
近期 IDC 发布报告,显示亚太企业 GenAI 应用增长快,AI 产业从开发到应用落地。这催生 AI 原生云,GMI Cloud 等新兴厂商崛起。同时,企业面临算力管理成本高问题,推理需求重塑市场格局,为中企出海带来机遇。
开源共建重塑推理 Infra:从架构创新到生态协同,Mooncake的破局之路
大模型推理落地面临成本、吞吐、长上下文“三角困境”。开源项目Mooncake以“计算存储解耦”为核心,通过PD分离等技术提供底层支撑。直播邀请专家从多视角拆解其技术逻辑、开源价值与企业实践。
阿里云秘密武器亮相顶会:狂砍82%英伟达含量,213块GPU干了1192块的活
阿里云与北大合作,由CTO周靖人带队的研究提出GPU池化系统Aegaeon,亮相顶会SOSP。它用token级自动扩缩容技术,将GPU使用量从1192个减到213个,提升了资源利用率,还在百炼平台测试成功。
AGI前夜重磅:RL突破模型「认知上限」,真·学习发生了!
AI研究圈争论RL能否赋予模型超越基础模型的推理能力。UC Berkeley等团队提出DELTA框架,观察到“RL grokking”现象,还设计新任务验证,提出两阶段奖励调度,总结两种模式等,为争论带来新依据。
Claude Skills,4000字详解 Anthropic 的思考
Anthropic推出新技能Claude Skills,作者认为它会引导第三方工具形态。Skills结合笔记式形态、可执行工具与AI调度自优化,具备低门槛、灵活表达等优势,还实现了AI自我进化,是一种新范式。
代码里插广告,腾讯 Codebuddy 们 “背锅”?DeepSeek “极你太美”事件,其他模型也逃不掉?
网友发现腾讯 Codebuddy 改写代码时插入广告,字节 Trae 国内版生成结果有‘极’字 bug,根源指向 DeepSeek V3.1。除 DeepSeek 外,Gemini、Grok、Qwen3 等模型也有类似问题。大家对原因有多种猜测。
从需求到研发全自动:如何基于Multi-Agent架构打造AI前端工程师
本文介绍蚂蚁消金前端团队打造的Multi - Agent智能体平台“天工万象”。阐述其技术实践,对比多Agent与统一型Agent、ReAct范式与固定工作流优劣,还介绍专业智能体建设,分享开发中的思考与经验。
关于 AI Agent,「实在」、「好用」可能比「颠覆」更重要
8月18日百度AI Day上,百度文库、网盘联合发布全端通用Agent「GenFlow2.0」。它无需邀请码,多专家协助,能利用文库和网盘数据,实测在多场景表现超预期,稳定高效,“好用”才是关键。
基于闪电注意力机制,创新高效开源大模型
传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。
图解Vllm V1系列7:使用AsyncLLM做异步推理
文章因异步RL讨论热,探讨用vllm做最小程度异步二次开发。介绍如何用AsyncLLM做异步推理,分析单条请求处理流程及阶段,说明并发提升效率的方法,还提及多请求并发及构建异步推理引擎思路。