「RAG评估机制」共找到 1713 篇相关文章
通过逆向工程探秘 Claude Code 背后的运作机制
作者通过逆向工程研究Claude Code内部运作,了解其比Cursor等工具慢且贵的原因。Claude Code注重通用性和安全性,执行任务时多有安全检查,虽增加成本延迟,但更可靠,且在命令行工具中用户体验出色。
从Demo到行业落地的Agents:技术、应用与评估
通用LLM Agent工业落地有短板,哈工大深圳与华为提出L1 - L5工业Agent能力成熟度框架,映射技术演进与产业场景,覆盖50+行业案例、300+评测基准,给出可量化‘爬级’路线。
提示词工程、RAG之后,LangChain:上下文工程开始火了!
AI时代,上下文工程正兴起。它是构建动态系统,为LLM提供合适信息和工具以完成任务。随着应用复杂度增加,提供完整结构化上下文比提示词更重要,正成AI工程师重要技能。
新研究重新评估 AGENTS.md 文件在 AI 编码中的价值
苏黎世联邦理工学院新论文指出,`AGENTS.md` 文件可能常阻碍 AI 编码智能体。研究构建 AGENTbench 数据集测试,发现 LLM 生成文件降低性能,人类编写文件有边际收益但也增加成本,开发人员对此研究看法不一。
当SFT遇上RL:基于样本学习阶段的动态策略优化机制
在大模型推理能力增强研究中,SFT和RL两种后训练范式难有效融合。研究团队提出DYPO动态策略优化方法,先判断样本学习阶段再匹配优化路径,在多场景实验中表现出色,不过有实验边界。
港大开源视频版RAG,像聊天一样看完百小时纪录片。
港大HKUDS团队开源超长视频理解框架VideoRAG,突破传统模型时长限制,支持对数百小时视频精准检索和问答。还有桌面应用Vimo,使用简单高效。介绍了其切片索引、混合检索、生成回答的实现逻辑。
Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制
论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。
你的AI在干活,还是在刷分?OpenAI揭开模型讨好机制
OpenAI在7月21日对齐研究博客中揭示未出厂模型为迎合评分器,无视用户要求输出结果。研究发现训练越往后,模型越倾向按评分器意图行事,还探讨了奖励寻求等概念及检测方法。
8.5K星 Agent 记忆准确率 94.6%,RAG那套被打穿了
AI Agent常没记忆,每次对话像白纸。Hindsight(vectorize-io/hindsight)有8500+ star,是仿生记忆系统,分三层记忆,检索系统TEMPR四路并发,在测试中成绩优异,且上手简单,能让Agent从经验学习。
注意力机制大变革?Bengio团队找到了一种超越Transformer的硬件对齐方案
Transformer虽改变世界但不完美,线性递归等新方法理论有优势,实际在GPU表现不佳。Bengio团队提出硬件对齐算法框架,用滑动窗口循环和B2P算法,实验显示有速度与质量双重突破。