超低延迟」共找到 3024 篇相关文章

算法论文8

为MoE解绑:全新「专家即服务」推理架构发布,细粒度扩展锐减37.5%成本

近年来大模型推理开销增长,MoE架构虽能避免计算量同比增,但带来扩展性差、容错性、负载不均等问题。为此作者提出全新「专家即服务」推理架构EaaS,实验显示它能锐减37.5%成本。

机器之心
开源动态8

小米的首代机器人VLA大模型来了!丝滑赛德芙,推理延迟仅80ms丨全面开源

具身机器人成科技新热点,大家期待其释放生产力。小米首代具身VLA大模型Xiaomi - Robotics - 0抓间歇停顿问题,4.7B参数规模下推理延迟仅80ms,还做三项技术创新,且全面开源。

量子位
算法论文8

搜索Agent最新高效推理框架:吞吐量翻3倍、延迟降至1/5,还不牺牲答案质量丨南开& UIUC研究

大语言模型驱动的搜索智能体有能力但效率。南开和UIUC研究人员剖析效率瓶颈,提出SearchAgent-X框架,实现吞吐量提升、延迟,且不牺牲答案质量,还揭示AI智能体平衡和等待问题。

量子位
新闻资讯7

英伟达护城河又宽了!调收购开源算力调度王牌工具,全球过半顶级算在用,Thinking Machines也离不开它

英伟达调收购SchedMD,其为Slurm系统核心开发商,该系统被全球半数TOP500级计算机等使用。收购整合成本、战略价值高,英伟达承诺保持Slurm开源,但相关项目开发受关注。此外,英伟达还推出Nemotron 3系列开源模型。

量子位
推荐文章8

从「降本增效」到「智能中枢」:代码在 AI 浪潮中的价值重估——专访金现代赵鹏程谈企业数字化转型新引擎

LowCode码时代专访金现代轻骑兵代码PaaS平台产品经理赵鹏程,探讨AI与代码融合对软件工程范式革新和企业数字化转型的影响。介绍了代码价值重估、应对新兴技术、企业实践、跨越工程化鸿沟路径、核心竞争力及未来展望等内容。

AIGC开放社区
开源动态7

OCR又出宠OpenDoc,速度MinerU6倍

复旦开源的OpenOCR是面向通用OCR任务的开源平台,其OpenDoc是轻量文档解析系统。它采用Pipeline模式,两阶段解析不易放大误差。UniRec - 0.1B有独特架构与分层监督训练等创新技术。

CourseAI
新闻资讯7

英伟达半数打工人身家过亿!难怪离职率

一份调查显示英伟达约半数员工身家2500万美元,78%百万美元。管理层富翁数字更惊人,公司离职率仅3.7%。其造富源于员工持股和限制性股票计划,近期又宣布芯片量产。

量子位
算法论文8

清华大学x生数科技:从波形到隐空间,AudioLBM引领音频分新范式

音频分辨率是提升音频体验的关键技术,但高频细节损失是挑战。OpenAI的Sora 2树立高保真音频生成标杆,现有学术模型有局限。清华与生数科技团队发表两项成果,AudioLBM展现通用高分辨率音频生成潜力。

量子位
新闻资讯7

存储市场为何“”了又“”?

近日,闪迪宣布调涨NAND闪存合约价,三星等巨头财报业绩预期。摩根士丹利预计存储行业将迎‘级周期’。存储芯片全品类产品齐涨,终端与资本共振。本轮涨价因AI需求爆发与产能重构,未来市场前景好但有不确定性。

芯师爷
新闻资讯8

刚刚,老黄官宣在中国台北建AI算!

英伟达CEO黄仁勋在Computex 2025演讲官宣,将在中国台湾建首台世界级巨型AI算及新总部,还推出GB300等新品,介绍NVLink Fusion等亮点,展望AI发展及通用机器人市场。

新智元