端到端加速」共找到 2803 篇相关文章

新闻资讯8

首个Gemini桌面曝光,系统级Agent空降PC!

5月20日Google I/O 2026前夕,谷歌提前“放大招”,Gemini桌面曝光,Mac版先上线。它具备四大核心功能,如系统级Agent操控PC等。全新Gemini 3.2闪现,编程能力惊人,谷歌还更新Workspace应用图标。

新智元
产品应用7

让YOLO飞起来:从CPUGPU的配置指南

文章指出默认安装的YOLO用CPU计算,处理大量图像或实时检测任务效率低。详细介绍将YOLO从CPU模式切换GPU模式的步骤,对比性能,还给出常见问题解决办法,能显著提升运行效率。

机器学习AI算法工程
新闻资讯7

太疯狂了!Meta裁员裁田渊栋头上,连组员一锅

Meta AI大裁员裁田渊栋头上,还整组裁。田渊栋在Meta工作超十年,是FAIR研究科学家总监,开发过“Dark Forest”等。他成果多,OpenAI等已在抢人,此次裁员或不简单。

量子位
推荐文章7

从金融本位物理本位,真正的范式转移开始了

过去几十年,人们认为增长可由货币政策调控,但如今瓶颈转移。马斯克描述的闭环体现从“金融本位”“物理本位”的范式转移,科技巨头已按此逻辑行动,锁定物理资源。

newtype AI
算法论文8

VLA 推理新范式!一致性模型 CEED-VLA 实现四倍加速

近年来,VLA模型成机器人领域重要研究方向,但推理速度受限。本文提出一致性蒸馏训练、混合标签监督机制及提前退出解码策略,在多基线模型上实现超4倍推理加速,实验验证其高效通用。

机器之心
算法论文7

手机上实现AI视频实时生成,DiT模型上移动

扩散变换器在视频生成任务性能强,但计算成本高,在手机上难实用。Snap提出创新优化法,加速视频生成,能在iPhone 16 Pro Max上每秒超10帧,不过也存在细节退化等局限。

带你学AI
算法论文8

谷歌的DeepSeek时刻:LLM推理加速被干了8倍

谷歌TurboQuant论文介绍量化算法,能为大语言模型和向量搜索引擎大规模压缩。可将大语言模型KV缓存内存减至少6倍、加速达8倍且精度零损失,还介绍其工作原理及实验结果。

PaperAgent
推荐文章7

Mini-sglang-01:从ClientScheduler的消息流转之旅

文章围绕轻量化大模型推理系统mini - sglang,详细介绍消息从客户经APIServer、TokenizerScheduler的流转过程,分析核心组件功能、消息体系、正反向链路及优化策略,还预告后续分析调度和模型实现逻辑。

GiantPandaLLM
算法论文8

ICCV 2025 | EPD-Solver:西湖大学发布并行加速扩散采样算法

扩散模型成生成任务主流技术,但逐步去噪机制致推理延迟大。西湖大学提出 EPD - Solver 算法,融合三类加速思路优势,可减少积分误差、提升生成质量,还能作插件集成,突破扩散模型速度与质量权衡瓶颈。

机器之心
开源动态8

AI+ Kuikly:7.5小时落地三「多模态聊天 App」实战

腾讯开源的高性能跨框架 Kuikly,搭配 AI 开发,仅用 7.5 小时交付一套支持 Android、iOS、鸿蒙三的 AI 聊天 App。介绍了开发过程,包括环境准备、需求分析、编码实现、集成自测、迭代优化和验收复盘,展示了“AI + Kuikly”的高效。

腾讯技术工程