「流处理架构」共找到 2796 篇相关文章
打破视觉Token的算力诅咒,RedundancyLens如何为多模态大模型推理减负
多模态大模型的 Decoder - only 架构处理视觉 Token 有计算冗余。合合信息团队提出无需额外训练的动态计算削减方法,在不影响性能前提下降低推理成本,适用于多场景。
告别Transformer,重塑机器学习范式:上海交大首个「类人脑」大模型诞生
上海交通大学团队发布首个「类人脑」大模型 BriLLM,脱离传统 Transformer 架构限制。它基于 SiFu 学习机制,有可解释性、能无限处理上下文等优势,还支持多模态融合,已获交大重点项目资助。
Transformer与RNN合体,谷歌打下显存门槛,解锁超长上下文
谷歌论文提出 Memory Caching 技术,通过架构机制创新赋予 RNN「可生长的记忆容量」,兼顾 Transformer 与 RNN 优势,能处理更长文本、降低推理资源门槛,实验显示有良好效果。
ICLR 2025新成果:文档检索“降本增效”,从此“开挂”
传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展到图文+音频多模态匹配。
π0.7发布,VLA押出了机器人的GPT-3时刻
今天凌晨,Physical Intelligence发布VLA模型π0.7,首次在机器人领域证明组合泛化。它用多样化prompt处理多样数据,涌现多种能力,还证明数据过滤可能是伪问题,架构基于前作,推动VLA回归。
上下文窗口限制被打破:Subquadratic推出了一个1200万Token的窗口
2026 年前沿模型宣传至少 100 万 Token 上下文窗口,但利用不佳。Subquadratic 推出能处理 1200 万 Token 窗口的模型,称可绕过问题,还将推 5000 万窗口模型,其 SSA 架构有优势,基准测试成绩佳。
智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析
智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。
DeepSeek悄悄开源LPLB:用线性规划解决MoE负载不均
昨天,DeepSeek 在 GitHub 上线新代码库 LPLB 解决 MoE 负载不均。它利用线性规划算法优化专家并行工作负载分配,能处理动态波动,但也存在忽略非线性成本等局限,对 MoE 架构训练加速有参考价值。
美团面试题:如何设计多轮对话智能客服Agent。评论区吵翻了,但答案可能就一句话。
文章围绕美团面试题,探讨如何设计多轮对话智能客服Agent。指出AI Agent核心是Context Engineering,介绍业内架构,强调给AI不同容忍度、分步骤处理复杂问题,还提及解决体验问题,认为产品要知边界。
GPU为什么能取代CPU,成为计算领域无可争议的核心?
文章介绍GPU取代CPU成计算领域核心的原因。对比二者架构差异,指出人工智能、大数据和HPC等领域需并行处理,GPU正擅长此。软件支持也推动其普及,未来还会在更多领域发挥作用。