「高效长上下文建模」共找到 1402 篇相关文章
比OpenClaw还狠!奥特曼押注「心灵感应」,Codex直接读取你的屏幕
4月21日,OpenAI上线Chronicle研究预览版,它能读取屏幕内容形成记忆图谱,帮Codex理解上下文。虽解决AI失忆短板,但吃Token且有隐私风险,这是其在用户记忆战争的首枪。
英伟达下一代GPU登场,Rubin CPX一次推理数百万Token,网友:这是头野兽
在周二的AI基础设施峰会上,英伟达宣布推出专为超100万token长上下文推理设计的Rubin CPX GPU。它将与其他产品组成新平台,性能卓越,还能复用现有平台,预计2026年底上市。
MCP高手进阶【一】:彻底弄懂生命周期管理器(Lifespan)的机制与用法
文章深入解读MCP SDK开发高级技巧,聚焦生命周期管理器(Lifespan)机制与用法。先介绍Python上下文管理器,再讲FastAPI的lifespan,接着说明MCP Server的使用流程,最后分析不同传输模式下的工作方式。
首个多模态工业信号基座模型FISHER,权重已开源,来自清华&上交等
清华、上交等团队联合发布首个多模态工业信号基座模型 FISHER,用搭积木法对异质工业信号统一建模。技术报告和权重已开源,还提出 RMIS 基准评估性能,实验显示其泛化能力强。
我国科研团队,突破了存算一体技术瓶颈
AI浪潮倒逼半导体产业创新,存算一体技术应运而生。但该技术应用存在问题,排序难题制约其发展。北大团队国际首次实现基于存算一体技术的高效排序硬件架构,成果发表在《自然∙电子》。
静态稀疏已死:Flux Attention 开启长文本 LLM 自适应推理新时代
文章指出长上下文LLM高效推理面临性能与效率难题,先介绍Elastic Attention打破静态稀疏桎梏,后重点阐述全新的Flux Attention,它将动态稀疏注意力范式升级为层级别路由,解决了算法与硬件的矛盾,在多方面实现突破。
下一代搜索:通过 MCP 实现 AI 与 OpenSearch 的融合
本文探讨 MCP 如何在 AI 代理和 OpenSearch 间建桥梁,创建智能搜索应用。介绍搜索从关键词到代理的演变,还通过电商、可观测性等场景演示代理搜索实践,显示 MCP 与 OpenSearch 结合能带来上下文感知的智能数据访问体验。
比SOTA快9倍,谷歌DeepMind时空重建,把视频变成时空搜索引擎
谷歌DeepMind联合团队发布D4RT时空重建框架,颠覆传统视频转3D方法。它按需提问,像搜索引擎,处理动态视频高效。内部结构分编码、解码两步,速度快,还发明聪明收割机算法,在多项测试中表现优异。
阿里妈妈发布MUSE:用多模态搞定十万级超长行为序列,并开源Taobao-MM数据集
阿里妈妈与武汉大学团队发布 MUSE 框架,用于终身用户兴趣建模,能处理 10 万级超长行为序列。还开源 Taobao - MM 数据集。MUSE 可插拔,已在阿里妈妈展示广告精排模型全量上线,提升 CTR 等指标。
阿里 Qoder 把这层 AI 编程的窗户纸捅破了
2025年大模型下沉到应用层,浏览器和编程工具被重新发明。阿里新发布的Agentic编程平台Qoder,增强对巨大代码工程理解能力和代码生成准确率,其上下文工程观是突破,新引入的Quest Mode很独特。