高可用机制」共找到 2803 篇相关文章

算法论文8

NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了

大型语言模型推理延迟、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难学 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。

机器之心
开源动态7

本文关注vllm V1中管控模型分布式推理的Executor部分,介绍其类型、Executor-Workers架构及数据传输机制,对比V0架构优势,以单机多卡的MultiprocExecutor为例展开讲解,还提及不同数据量的传输方式及相关代码。

猛猿
新闻资讯7

每周产业洞察|校园母题与流量要素成为AI短剧行业的爆款公式

近期AI短剧行业数据亮眼,TikTok生态和国内市场规模惊人,但淘汰率也。其有“校园母题+流量要素”爆款公式,AI降低制作成本,工具平台参与度加深,且用户画像向男性、游戏用户迁移。

郎园Station
推荐文章8

超长 Agent 任务如何不崩盘:Claude Code 上下文管理机制深度拆解。

文章深度拆解Claude Code上下文管理机制,包括七类上下文、预算与告警、加载、卸载机制等。指出其是分层缓存与多级预算管理系统,还为长任务Agent开发者提供了管理启示。

AI大模型应用实践
算法论文8

重构线性视觉Transformer,精度与效率双平衡 | CVPR'25

南洋理工、北航与合工大联合提出CARE Transformer,以非对称解耦建模局部与全局,降低计算开销、提升特征表达。实验显示其在移动端低延迟精度,打破“效率与精度不可兼得”困局。

新智元
算法论文8

大象秒变挖掘机!三维变形新突破,无需额外训练 | CVPR'26

南京大学与北京大学提出MorphAny3D,无需额外训练即可让三维生成模型实现跨类别平滑变形。它通过创新注意力机制融合源与目标特征,精准控制结构与时序,效果远超传统方法,代码已开源。

新智元
产品应用7

Claude版Manus宕机,全网炸锅!顶级开发者曝光致命缺陷

Claude Cowork开年爆红,引发大量关注和讨论,两天内浏览量达五千万,甚至因太火爆致Claude用量太大而宕机。Django之父Simon Willison揭露其核心机制,也指出存在提示词攻击风险。

新智元
产品应用7

AI+直播的新玩法! StreamDiffusionV2让创意零延迟

生成模型改变直播行业,但此前模型难保证时间一致性、有延迟等问题。加利福尼亚大学推出StreamDiffusionV2,通过智能调度和缓存机制优化,支持多GPU并行,可灵活调画质和延迟,实现实时直播。

带你学AI
算法论文8

Flash-Searcher:Web Agent的并行革命

当下Web智能体用顺序执行链解决复杂任务存在执行和信息利用率低的问题。为此提出Flash - Searcher,以DAG并行执行机制为核心,提升执行吞吐与速度,在多基准上表现优,代码已开源。

深度学习自然语言处理
开源动态8

美团开源新模型,多项能力实测第一

美团发布5600亿参数的LongCat - Flash模型,有创新动态计算机制效训练推理架构。它在多项测评中领先,尤其在代理工具使用测试表现出色,还以宽松许可开源,降低使用门槛。

AIGC开放社区