「长上下文窗口」共找到 1220 篇相关文章
英伟达帮你省钱,让大模型推理「短而精」,速度快5倍
过去大模型推理追求长链思维,导致推理链长、Token消耗大、响应慢。英伟达研究院的DLER研究给出解决办法,通过强化学习优化方法让模型‘短而精’,推理长度减超70%且准确率不变,还适用于大模型。
比 Context7 更靠谱:Exa-code 靠 1B+ GitHub 与 Stack Overflow 减少幻觉
Exa团队索引超1B+文档、GitHub仓库等内容,exa - code对其混合搜索、分块处理。它是首个为编码代理制作的Web规模上下文工具,在代码幻觉评估中表现超流行网页搜索工具,核心技术有专为AI的搜索引擎和高效返回上下文。
Clawdbot 如何搭建永久记忆管理系统:全靠 MD 文档
AI研究工程师Manthan Gupta复盘Clawdbot记忆机制,其记忆用MD文档存档,有双层记忆系统。系统有独特管理方式,如压缩、记忆刷新等,坚持透明度、搜索、持久性、混合等原则。
浏览器秒变 Mac 终端,有点意思!
介绍开源工具 VibeTunnel,它能把浏览器变 Mac 终端,支持远程操控。零配置、跨设备、实时同步,无需 SSH 密钥等。有跨设备访问等多种特性,给出不同系统安装方法和使用步骤。
Uber&WisdomAI揭露95%AI Agent落地失败的真相 !
在‘Beyond the Prompt’技术论坛上,Uber、WisdomAI等企业揭开AI智能体落地难症结。指出90%失败源于‘喂错料’,信任是落地‘生死线’,记忆是架构设计,多模型编排与场景化交互决定用户体验上限。
大语言模型(LLM)到底是怎么运作的?(配图通俗讲解)
文章先介绍条件概率,指出大语言模型预测下一个单词是条件概率问题,会计算所有可能单词的条件概率选最高的。还提到直接选最高概率会使内容单调,引出温度概念,它能调整概率分布影响抽样结果。
MiniCPM 4.0来了!220倍极速狂飙,端侧模型的比赛,结束了
面壁智能联合清华发布MiniCPM 4.0,极限场景220倍加速。它是首个原生稀疏模型,有三级火箭推理加速体系,性能强,适配全平台,应用广泛,或成端侧AI分水岭。
逆向工程:ChatGPT 的记忆是如何工作的
文章是工程师eric对ChatGPT记忆系统的深度逆向工程和技术实现推测,详细拆解‘可保存记忆’和‘聊天历史’,分析工作原理、实现方案,探讨其对提升用户体验的作用,认为‘用户洞察’是关键。
用 LLM Wiki 给自己搭一个会越用越值钱的第二大脑
这是基于Andrej Karpathy的LLM Wiki模式构建的开源项目,能方便实现第二大脑。上传资源后Claude会主动提取实体、建立概念网络,知识会‘自己生长’,用得越久边际价值越高。还介绍了安装及使用方法。
第 3 章 Agent 核心功能技术详解
本章以Claude Code及其生态为主参照,介绍现代Agent平台提供类似‘操作系统’机制,包括命令、记忆等。面向熟悉Python与LLM的开发者,按是什么、解决什么问题等展开,还分析了Agent工程核心挑战。