「多上下文模式匹配」共找到 1621 篇相关文章
Qwen3-Next全新架构,32K场景MTP吞吐提升10倍
随着模型大小和上下文长度增加,为应对成本和部署挑战,Qwen3 - Next有突破性架构创新,解决上下文长度和总参数缩放问题。它采用混合注意力、超稀疏MoE等,MTP机制让其长上下文推理吞吐量比前身高10倍以上。
性能提升 10 倍,零改造实现 DIFY 模式迁移至 Spring AI Alibaba 模式
文章深度讲解如何将 Dify 平台开发的应用导出为 Spring AI Alibaba 工程。先介绍两者特点,后通过示例展示转换过程,还阐述迁移收益,如扩展灵活、性能提升 10 倍,最后提及 Spring AI 后续计划。
Claude Code 开发者分享:如何管理百万上下文
Claude Code开发者Thariq分享管理百万上下文的心得。介绍了context概念、腐烂问题及压缩机制,提出完成操作后的五条岔路,还给出不同场景的决策建议,强调会话管理要平衡信息量和注意力。
多快好省,Qwen3混合部署模式引爆MCP
文章介绍Qwen3混合部署模式在MCP中的应用。MCP是AI与外部交互的标准协议,解决传统问题。Qwen3性能强、成本低,有混合思维等特点。通过本地小尺寸和满血版结合部署,实现多快好省,但仍有资源消耗等不足。
姚顺雨腾讯首篇论文:给AI下半场指路“上下文学习”
姚顺雨入职腾讯后首个成果CL - bench,用来测试大模型“从上下文中学习”能力。研究指出当下模型多依赖“过去”知识,无法适应“当下”学习。评测中,十个前沿模型表现不佳,揭示其真实场景应用缺陷。
DeepSeek-V4发布!高效百万上下文智能普惠时代来了
DeepSeek-V4发布,是开源社区关键分水岭。它解决超长文本处理效率痛点,架构与优化有多项突破,降低算力消耗和成本,适配国产芯片,性能比肩顶级闭源模型,推动开源社区两大未来趋势。
我的天!MCP开发,从“地狱模式”秒变“傻瓜操作”
作者分享FastMCP工具,它让MCP开发从难变易。过去开发MCP耗时久、Bug多,用FastMCP,186秒可本地搭建,还能上云、部署到Cloudflare Worker,降低AI工具开发门槛。
Anthropic说:Session Management 是最好用的 Harness Engineering!
Anthropic指出管理Session、Context等在Claude Code上已落地。模型上下文并非越长越好,rewind比纠错好,compact要把握时机,subagent可隔离上下文,如今行业看重agent产品runtime。
DeepSeek开源新模型,提出上下文光学压缩:LLM的新记忆方式
DeepSeek开源OCR模型,探索用多少视觉信息让LLM理解文本。实验表明1000字文档约需100个vision tokens,压缩比10倍、准确率97%。还提出模拟人类遗忘等想法,有多种应用场景,且完全开源。
TACO: 让 CLI Agent 在自主迭代中学会丢掉无用上下文
由多校及研究团队联合提出 TACO,这是无需训练、即插即用的终端智能体自进化观测压缩框架。它能让智能体学习压缩规则,过滤低价值输出,保留关键线索,实验显示其提升了任务成功率和 token 效率。