超低延迟」共找到 3034 篇相关文章

算法论文7

腾讯LLM团队:对下一个 Token 预测的深入剖析,多样性 or 精准度?

最新研究证实RL能增强LLM推理,但成效受限预训练token分布。腾讯LLM部把交叉熵重写成单步策略梯度,用参压熵,为RL打造‘熵高信号’起点,经实验验证熵模型优势明显。

PaperAgent
算法论文8

GPT-5刷屏吊胃口之际,英伟达发出暴论:小型语言模型才是未来

英伟达新论文指出,未来属于小型语言模型(SLM),挑战了智能体需用大型语言模型(LLM)的假设。SLM参数量于100亿,有延迟成本等优势,还给出从LLM到SLM迁移路线图。

AGI Hunt
开源动态8

冲上热搜!美团大模型,靠「快」火了

国内外开发者亲测,美团新开源的LongCat - Flash - Chat模型速度快,推理速度每秒100个token。它来自美团LongCat - Flash系列,官网可直接用。该模型架构创新,训练方法高效,还做了专属和系统级优化,跑起来又快又便宜。

机器之心
推荐文章7

为什么 DeepSeek 大规模部署很便宜,本地很贵

文章探讨了DeepSeek-V3大规模服务便宜但本地运行贵的原因。指出推理服务存在吞吐量和延迟的权衡,受批处理大小影响。还分析了不同模型需大批次的原因,如专家混合模型、大型管道模型等。

AI前线
新闻资讯7

OpenAI「辣椒芯」干翻英伟达!老黄股价不跌反涨

OpenAI自研芯片「小辣椒」跑分碾压英伟达最强blackwell,延迟、高吞吐、并发等全达SOTA级别。但英伟达股价未跌反涨,OpenAI也表态不会弃用英伟达。「小辣椒」预计2027年量产,OpenAI还将开发后续版本,不过其数据中心负责人离职,无人接手。

量子位
产品应用7

刚刚,全网最猛AI视频模型免费了!我们手搓了一段「牛来」,效果绝了

AI短剧火爆,但创作者面临成本高痛点。Agnes Video 2.5系列模型上线Pavo平台,成本效果好,其Flash版免费。Pavo还有「无限画布」和「Agent创作模式」,降返工成本,实现门槛创作。

新智元
新闻资讯8

台积电的利润率赶上茅台了

美东时间4月16日,台积电公布2026年Q1财报,营收、利润预期,毛利率66.2%,净利率首破50%茅台。先进制程占比攀升,HPC成营收主引擎,资本开支高,供应紧张至2027年。

芯师爷
新闻资讯8

时隔九年,中国级计算机重登世界榜首

当地时间6月23日,第67届TOP500级计算机排行榜发布,国家级计算深圳中心的‘灵晟’(LineShine)夺冠,运算速度达2.198 ExaFLOP/S。它仅用CPU,性能美国El Capitan20%,引发对未来计算架构思考。

DeepTech深科技
开源动态7

强开源OCR,手写体识别能力dots.ocr,封存多年的老文档数字化有救了。

文章推荐新开源的OCR系统Chandra,它对手写体识别做了优化,官方测评数据显示比dots.ocr强。介绍其适用于多场景及功能特点,还展示了不同场景的识别效果,建议有需求者多对比测试。

开源AI项目落地
开源动态7

深度体验多功能的开源AI菜谱工具,AI让每个人都可以是米其林大厨。

文章推荐了开源AI菜谱工具“一饭封神”,它能根据食材、口味、人数等生成菜谱,还有营养分析、饮品搭配等功能,有多种趣味板块,可玩性和实用性强,比部分小红书菜谱靠谱。

开源AI项目落地