「关键token检测」共找到 1818 篇相关文章
Meta最新REFRAG框架引爆RAG圈!KV缓存暴降90%,速度狂飙30×
Meta推出REFRAG框架解决RAG难题。它能在不修改解码器参数下压缩上下文、复用文档向量等。实验显示,它降低KV缓存、加速TTFT,在多任务表现佳,为大模型与知识库结合提供新范式。
吴恩达来信:智能体并行运行以提升效率
吴恩达称并行智能体成扩展AI规模新方向。AI性能会随数据量、训练及推理计算量提升,但耗时久。随着LLM每个token价格下降,更多智能体工作流被并行化,且相关研究增多。
专治智能体盲跑!微软发布AI Agent 5大可观测性,打通任督二脉
今天凌晨微软官网发布AI Agent 5大可观测性最佳实践,解决智能体盲跑等难题。介绍了智能体可观测性概念和好处,展示5个应用案例,还阐述5大实践,如选模型、持续评估、集成CI/CD等。
90%打工人「自费买AI上班」,开启To P革命!每月花20刀效率翻倍
面对AI淘汰焦虑,大量职场人主动自费买AI工具,开启「自我拯救」运动,催生出To P新赛道。文章分析其发展快的原因,也提及To B和To C赛道后续发展的条件。
唯快不破:上海AI Lab 82页综述带你感受LLM高效架构的魅力
大语言模型性能提升但成本高,制约落地应用。上海AI Lab联合多家机构总结440余篇论文,形成82页综述,将LLM高效架构分为7类,探讨最新进展,还涉及线性化技术、硬件实现等内容。
清华校友出手,8B硬刚GPT-4o!单一模型无限工具调用,终结多智能体
MIT等机构推出TIM和TIMRUN组合拳,突破模型token天花板。TIM将推理建模为任务树,TIMRUN优化内存管理。二者结合支持长程推理,实现单模型高效推理,简化智能体构建,在多方面表现出色。
CAG又回来了,这次它带着RAG!
文章对比CAG和RAG,指出CAG虽解决RAG部分痛点,但有根本限制,对海量变化知识库,RAG不可替代。Aurimas将二者结合做「动态混合层」效果好,还给出实施架构和关键点。
智能体新范式Chain-of-Agents,多项任务新SOTA
论文提出Chain-of-Agents (CoA) 范式,结合多智能体系统与工具集成推理优势。通过多智能体蒸馏和智能体强化学习训练智能体基础模型(AFM),实验显示其在Web和Code任务上达新SOTA,效率、泛化性佳。
首个多模态工业信号基座模型FISHER,权重已开源,来自清华&上交等
清华、上交等团队联合发布首个多模态工业信号基座模型 FISHER,用搭积木法对异质工业信号统一建模。技术报告和权重已开源,还提出 RMIS 基准评估性能,实验显示其泛化能力强。
估值200亿,小米、宁德时代看中的半导体独角兽冲刺IPO
6月30日,芯迈半导体递表港交所拟上市。该公司专注功率半导体,获小米、宁德时代等投资,估值达200亿。不过近三年营收下滑、亏损加大,依赖大客户,此次IPO有“输血”意味,扭亏是核心问题。