RAG评估机制」共找到 1714 篇相关文章

算法论文8

视听分离SOTA提速6倍!清华发布首个6M高性能模型|ICLR'26

清华大学团队推出Dolphin模型,仅用6M参数,通过离散化视觉编码和热扩散注意力机制,实现单次推理精准分离语音,速度提升6倍以上,在多项基准测试中刷新纪录,为端侧设备部署开辟新路。

新智元
新闻资讯7

首钢园“产业跃升俱乐部”首秀:从WANOS全景声到波萝元宇宙

首钢园“产业跃升俱乐部”首期轮值活动“从WANOS全景声到波萝元宇宙”成功举办,标志开启月度轮值新机制。活动汇聚各方精英,探索创新驱动产业跃升路径,展示波萝元宇宙成果,还围绕技术与投资议题讨论。

首钢园
推荐文章7

Agent 真正的护城河,正在从工具转向记忆资产

2026年初,Anthropic用Claude Cowork引发AI创业热点,其计划引入知识库获“永久记忆”能力,将Agent Memory探索推到前沿。文章探讨独立Memory层成必需品的原因、工程化记忆系统的能力,还对比模型厂商和第三方中立派路线。

Founder Park
算法论文8

拿着做数学题的 PRM 来评判 Agent 调用工具,基本是行不通的!

目前评估体系多为结果导向,在工具调用上缺乏像样的PRM基准。Arizona State University和Intuit AI Research研究者推出ToolPRMBench,指出用做数学题的PRM评判Agent调用工具行不通,还介绍了其构建方法、训练范式和实验结果。

深度学习自然语言处理
算法论文8

刚刚,智元提出SOP,让VLA模型在真实世界实现可扩展的在线进化

智元具身研究中心提出SOP框架,可让VLA模型在真实世界实现可扩展的在线进化。它是颠覆性的机器人学习新范式,整合在线、分布式和多任务机制,构建闭环打破机器人认知时间边界。实验显示其性能优越。

机器之心
新闻资讯7

智能体的记忆管理机制及其潜在风险 | 直播预约

大语言模型(LLM)智能体兴起,记忆机制是核心。本次报告将探讨记忆管理对其性能的影响及潜在风险,展示缓解关键挑战的策略,介绍新攻击范式,揭示安全漏洞,强调需重新审视与建模。

深度学习自然语言处理
新闻资讯7

模力工场 025 周 AI 应用榜:传统SEO黄昏?蓝莺 GrowAI 说让品牌出现在 AI 答案里!

模力工场第 025 周 AI 应用榜揭晓,8 款应用上榜,涵盖营销、效率、设计等多领域。蓝莺 GrowAI 成榜首,其开发者分享构建经验,还谈 AIGC 对 SEO 影响等问题。此外介绍上榜机制与参与方式。

AI前线
新闻资讯7

GPT-5准确率不足40%!北大发布多模态、高难度化学基准SUPERChem

北大团队发布多模态、高难度化学基准SUPERChem,构建评估大语言模型化学推理能力新体系。测试显示,GPT - 5准确率仅38.5%,与低年级本科生相当,且模型在高阶推理有短板,该基准为模型优化指明方向。

新智元
算法论文8

谷歌发布智能体Scaling Law:180组实验打破传统炼金术

谷歌新论文通过180组实验找到智能体的Scaling Law(定量扩展原则),在四个基准测试评估,推导预测模型,实验结果颠覆直觉,还量化阻碍因素,发现不同模型协作性格,为智能体部署决策提供支撑。

机器之心
算法论文8

句子级溯源+生成式归因,C²-Cite重塑大模型可信度

在人工智能发展背景下,大模型内容可信度成焦点。北邮百家AI与小米团队提出溯源大模型C² - Cite,首创上下文感知归因生成技术,解决现有归因模型缺陷,已被WSDM 2026收录。

机器之心