「多跳数据集」共找到 2616 篇相关文章
HaluMem:让AI记忆系统的“幻觉”现形——首个面向记忆系统的操作级幻觉评测基准
过去一年,AI Agent的‘记忆能力’成热门话题,但AI记忆存在幻觉问题。为此发布操作级幻觉评估基准HaluMem,它能精准定位幻觉来源,评估主流记忆系统,为构建可靠记忆系统提供方向。
解决Agent幻觉:HaluMem精准定位记忆系统的“说谎”环节!
近年来,LLM和Agent在记忆管理上存在挑战,现有评估方法无法定位幻觉来源。论文提出HaluMem评估基准,通过三大任务和两个数据集揭示记忆系统幻觉行为,为开发可靠记忆机制提供指导。
连肝12小时!一轮狂刷1500篇论文,写4.2万行代码,AI科学家卷疯科研圈
Kosmos是一款全程无需人类插手的AI科学家,最长能连续工作12小时,平均一次研究读1500篇论文、写4.2万行分析代码,79%研究结果可被人类复现,已在多领域有7个真发现。
北大彭一杰教授课题组提出RiskPO,用风险度量优化重塑大模型后训练
北大彭一杰教授课题组提出 RiskPO,解决大模型后训练陷入「均值陷阱」问题。它将风险规避理念融入优化目标,用「关注奖励分布左尾」替代「追求整体均值」,在多领域数据集上表现超越 GRPO 等。
登上NeurIPS,Genesis开创无需OCC引导的多模态生成新范式,在视频与激光雷达指标上达到SOTA水平
华中科技大学与小米汽车提出多模态图像 - 点云联合生成框架Genesis,采用两阶段架构和DataCrafter模块。在nuScenes数据集实验显示,其在视频与激光雷达指标达SOTA水平,还提升了下游感知任务效果。
基于离散扩散模型的高效音频修复方法
数字音频时代音频易损坏丢失,传统修复法处理长间隙不佳。本古里安大学研究人员提出基于离散扩散模型的音频修复法,经MusicNet数据集实验验证,该方法在各间隙长度上表现优异。
关于 AI Agent,「实在」、「好用」可能比「颠覆」更重要
8月18日百度AI Day上,百度文库、网盘联合发布全端通用Agent「GenFlow2.0」。它无需邀请码,多专家协助,能利用文库和网盘数据,实测在多场景表现超预期,稳定高效,“好用”才是关键。
人大高瓴-华为诺亚:大语言模型智能体记忆机制的系列研究
中国人民大学高瓴人工智能学院与华为诺亚方舟实验室聚焦大语言模型智能体记忆能力,形成含综述论文、数据集和工具包的研究体系。探讨记忆概念、重要性、实现与评测方法,还构建评测榜单、实现工具包。
3D-R1:让AI理解3D世界的下一步
文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。
北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”
北京大学DS - Lab发布ScholarSearch,这是评估大语言模型学术检索能力的数据集,含223道高难度题目。评估显示现有模型表现欠佳,纯推理模型准确率低,有搜索功能的模型虽有提升但仍不足。