推理加速技术」共找到 4901 篇相关文章

算法论文8

华为CloudMatrix重磅论文披露AI数据中心新范式,推理效率超NV H100

华为发布60页重磅论文,提出下一代AI数据中心架构Huawei CloudMatrix及产品CloudMatrix384。它架构设计独特,性能高效准确灵活,打破算力、延迟和成本“不可能三角”,重新定义AI基础设施。

量子位
推荐文章7

深度剖析将 Kafka 构建在 S3 上的技术挑战与最佳实践

文章基于AutoMQ深入剖析将Kafka构建在S3上的挑战与解法。探讨延迟、IOPS、缓存管理等问题,介绍AutoMQ应对策略,如用WAL+S3架构降低延迟、批处理数据减少请求等,还提及Kafka兼容性及跨区流量成本处理。

InfoQ
开源动态8

阿里智能体多轮推理超越GPT-4o,开源模型也能做Deep Research

通义实验室推出自主信息检索智能体WebDancer,其通过系统化训练范式为构建智能体提供路径,也为在开源模型上复现Deep Research系统提供指导。它在多数据集测试中表现出色,团队还对其未来应用做了展望。

量子位
新闻资讯7

Palo Alto5亿美元收购的Portect AI都有什么产品和技术

2025年4月25日,Palo Alto Networks超5亿美元收购Protect AI,为客户提供端到端人工智能安全保障。Protect AI有两个开源软件ModalScan、LLM Guard和三个平台产品Gardian、Recon、Layer,防护方案完整。

AI与安全
开源动态7

微软开源多智能体自定义自动化工作流系统,加速搭建基于AI的自动化系统

微软开源多智能体自定义自动化工作流系统,可助企业用AI智能体实现复杂组织任务自动化。该方案整合多项Azure服务构建管道,有聚焦核心价值等功能,还给出部署指南与成本估算。

GitHubStore
算法论文8

RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力

多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。

机器之心
开源动态8

Agent的自演进,被刚刚开源的AReaL 2.0按下了加速

Agent 正从「会使用工具并完成任务」向「在使用中学习并改进方法」转变,但面临自演进难题。AReaL 2.0 上线,解决 Agent 服务侧问题,给出在线学习闭环方案,其价值已在实践中得到验证。

机器之心
产品应用8

探索 GPU 加速向量检索:NVDIA Cagra 在微信大规模推荐系统中的应用实践

本文分享腾讯团队将 Cagra GPU 图索引大规模应用于微信核心线上推荐业务的实践。介绍 Cagra 算法原理与优势,讲述线上化改造、架构演进、CPU/GPU 协同优化等,展示业务落地显著收益。

腾讯技术工程
开源动态7

OpenClaw 技术闭门:测试将比代码更值钱,Agent Computer 会是新的硬件形态

OpenClaw 持续发酵,从极客「玩具」变为生产力工具。闭门分享中,开发者们探讨了其在实际业务中的应用。如代码成负债,测试更重要;不同用户对 OpenClaw 认知差异大;Platform Engineering 成工程师核心,还提及 Agent Computer 新硬件形态等。

Founder Park
新闻资讯7

具身导航:感知推理是上帝,还是执行控制是命门?| GAIR Live 023期预告

具身导航正从‘几何避障’向‘空间智能’跨越,当前领域经历范式变革。GAIR Live 023期线上圆桌将聚焦其前沿进展与落地问题,邀请两位专家拆解底层逻辑,还给出了核心议题、讨论精华预览及参与方式。

AI科技评论