复制延迟」共找到 299 篇相关文章

推荐文章7

Cursor 重新定义 Agent:脑子再大,不如会翻书。

Cursor 分享博客指出,Dynamic Context Discovery 效果远好于 long context 方式,开启动态上下文可使总 Token 消耗降 46.9%,还能减成本、降延迟、提准确率,但也存在成本转嫁、工程复杂度高和安全风险等问题。

探索AGI
开源动态8

斩获7.4K标星!NotebookLM的终极开源平替,私有化多模态播客一键生成!

Google的Notebook LM虽能上传资料一键生成播客总结,但有数据隐私等问题。近期GitHub上的Open Notebook获7.4K标星,它复制并超越前者功能,强调数据主权,有多项亮点且部署灵活。

开源星探
新闻资讯7

入职仅一年,套现5000多万后背刺马斯克搬走 Grok 核心代码库!业内专家:拥有菜谱不等于能做出同样的菜

xAI起诉前员工Xuechen Li窃取商业机密,指控其复制代码库,可能使对手受益。业内专家认为大模型核心竞争力不全在代码,xAI可通过加强管控、研发等修复竞争力,还探讨了数据防泄漏系统问题。

InfoQ
算法论文8

东方理工团队提出HiDrop:重构MLLM计算路径,压缩90%视觉Token实现2.2倍加速

东方理工大学沈晓宇团队提出HiDrop,基于MLLM不同层功能差异,设计出延迟注入、凹金字塔式剪枝和提前退出的视觉Token压缩策略。实验显示,它能压缩约90%视觉Token,保持98.3%性能,实现训练和预填充加速。

机器之心
算法论文8

GPT-5刷屏吊胃口之际,英伟达发出暴论:小型语言模型才是未来

英伟达新论文指出,未来属于小型语言模型(SLM),挑战了智能体需用大型语言模型(LLM)的假设。SLM参数量低于100亿,有低延迟、低成本等优势,还给出从LLM到SLM迁移路线图。

AGI Hunt
推荐文章7

【博客转载】CUDA Shared Memory Swizzling

文章讨论用swizzling技术处理CUDA共享内存bank冲突,它可重排索引映射避免冲突且不浪费内存。以矩阵转置为例,对比有冲突、填充、swizzling三种实现,还分析了swizzling和填充优缺点。

GiantPandaLLM
产品应用7

OpenAI很看好!首个SWE-1模型发布,软件开发或将提速99%

Windsurf发布首个前沿模型SWE-1,目标将软件开发提速99%。它不只能写代码,还能协助软件工程流程。有三个系列模型,SWE-1运行成本低,SWE-1-lite对所有用户开放,SWE-1-mini适用于低延迟场景。

新智元
新闻资讯7

昆仑万维方汉:通用Agent是伪命题,AI Office仍有存在空间丨MEET2026

昆仑万维董事长兼CEO方汉在MEET2026提出新视角,认为Agent是可验证过程的自动化系统,擅长复制流程。其判断大模型从‘背答案’到‘背过程’跃迁,Agent先落地AI Office,重塑组织,人类成过程架构者。

量子位
算法论文8

NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了

大型语言模型推理延迟高、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难学 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。

机器之心
开源动态8

小红书最新开源TTS力作!4人对话自然无缝,毫秒极速响应!

近年来TTS技术爆发,但多人对话的自然流畅性和长序列稳定性一直是难点。小红书团队开源的FireRedTTS - 2是面向多人对话场景的TTS模型,实现自然切换和低延迟,支持多语言,适用于多种场景。

开源星探