「延迟」共找到 207 篇相关文章
Qwen3-Embedding 全揭秘:从技术到服务,打造高效AI产品的关键路径
文章全面揭秘 Qwen3-Embedding,介绍其核心原理、优势、应用场景。还给出在 PAI 和百炼平台的使用方法,含部署、推理、微调等。通过对比实验,凸显其低延迟、低成本特点,未来将成语义理解核心设施。
「双线实测」Qwen 3.6-Plus,Agentic Coding 已经这么能“扛活儿”了?
4月7日阿里云通义千问Qwen3.6-Plus上线,作者用两套真实复杂任务评估其智能体能力。结果显示它在复杂决策和编码任务表现出色,有工业级交付水准,但也有首字延迟等短板,且参数效率优势明显。
谷歌 DeepMind 发布机器人学基础模型 Gemini Robotics On-Device
谷歌 DeepMind 推出 Gemini Robotics On-Device,这是视觉 - 语言 - 行动基础模型,可在机器人硬件本地运行,低延迟且能针对特定任务微调。它是 Gemini Robotics 家族最新迭代,还发布相关基准测试。模型待广泛可用,SDK 可在 GitHub 找到。
Megatron 1F1B流水线并行中的负载不均衡问题研究
文章分析Megatron 1F1B流水线并行中负载不均衡问题。通过实验发现通信时间‘一短一长’,原因是最后一个Stage计算慢致不同步,额外计算引发通信延迟,还梳理了流水线各阶段执行过程。
Anthropic 的 Harness 哲学:把 Agent 当牲口,而非宠物
本文分享Anthropic最新两篇博客,介绍其将运维圈“宠物 vs 牲口”哲学用于AI Agent架构设计。旧架构如“宠物”易出问题,新架构脑手分离,把Harness做成可随时重启的“牲口”,降低延迟、提升安全,还提出信任框架。
Claude 最歧视的,是印度阿三
AI研究员Aran Komatsuzaki实验发现,Claude的tokenizer对非英语用户不友好,印地语用户消耗token是英语的3.24倍,带来高成本、高延迟等问题。不同模型对不同语言token处理有差异,市场份额影响token效率。
Telegram创始人搞了个狠活:100%隐私的去中心化AI网络
Telegram创始人帕维尔·杜罗夫推出专注机密AI计算的去中心化网络Cocoon,或终结中间商垄断。它基于TON区块链,有三层架构,四步完成AI查询,但面临延迟和竞争挑战,未来将采用DAO治理。
一文读懂:GPU到底是怎么工作的?
文章详细介绍GPU工作原理,对比其与CPU差异。指出GPU擅并行计算、能解决复杂问题,还分析FLOPS、延迟、内存等因素对性能的影响,最后讲了GPU通过多线程和超量订阅获高吞吐量。
马斯克AI女友直播「一秒变身」,Karpathy看完立刻投钱
世界首个支持直播推流的「实时」扩散AI视频模型MirageLSD诞生,大神Karpathy亲自站台。它能理解真实视频后同步生成AI视频,实现零延迟、无限时长、每秒24帧不卡顿,给视频娱乐和直播互动带来丰富想象。
突发!OpenAI「掀桌」:自研推理芯片「墨西哥辣椒」跑赢英伟达
OpenAI公布自研推理芯片Jalapeño(墨西哥辣椒)测试结果,它专为大语言模型推理设计,能同时提升吞吐量和降低延迟,在多模型测试中超NVIDIA系统。该芯片与Cerebras合作,计划2026年底部署。