「查询精炼」共找到 92 篇相关文章
Agent搜索哪家强?人大高瓴&快手联合发布全新评测基准GISA
人大高瓴与快手联合发布全新评测基准GISA,用于评估智能体搜索能力。它解决了现有基准反向构造、评估维度单一、答案易被记忆等问题,含373个高质量查询,实验显示当前搜索智能体距人类水平差距大。
谷歌DeepMind「粪坑淘金」全新方法,暗网毒数据也能训出善良模型
谷歌DeepMind研究团队发表论文提出生成式数据精炼(GDR)方法,不直接生成新数据,而是用大模型净化原始数据,保留有用信息。该方法能解决数据枯竭、隐私等问题,实验显示效果良好。
国产AI击败Meta:ReasonRank荣登BRIGHT榜单第一
基于LLM的段落排序方法中,listwise排序虽有优势,但当前重排器难处理复杂推理查询。ReasonRank通过生成推理密集型训练数据及两阶段后训练,赋予listwise重排序器强推理能力,在BRIGHT榜单击败Meta。
抢先体验GenFlow2.0:未来多Agent协作的理想形态
作者在百度邀测会抢先体验Genflow 2.0,用其解决小学教改信息查询问题,还让它生成创意图片。它得益于“沧舟OS”,有流畅、并发且跨模态能力,架构全自研,测试版亮点多,值得期待8月正式上线。
BRIGHT榜单SOTA!人大&百度ReasonRank:用推理增强的段落重排序器
传统listwise在复杂查询表现差,近期工作泛化性不佳。人大与百度等提出ReasonRank,通过全自动合成13K推理数据及两阶段训练,在BRIGHT等榜单表现优异,且ReasonRank-7B比Rank1-7B快2.5倍。
AI自己给自己当网管,实现安全“顿悟时刻”,风险率直降9.6%
大型推理模型有安全风险,此前监督微调泛化能力有限。SafeKey团队提出创新的SafeKey框架,发现大模型信息“越狱”两大核心,通过双通路安全头和查询遮蔽建模强化模型安全,实验验证其有效性。
最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代
人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。
73%人类认同率!Video-Bench实现视频质量精准打分
上海交大等团队提出视频评估框架Video - Bench,让多模态大模型‘像人一样评判视频’。它构建双维度评估框架,引入链式查询和少样本评分技术,与人类判断73%高相关,为视频生成模型优化提供标尺。
Telegram创始人搞了个狠活:100%隐私的去中心化AI网络
Telegram创始人帕维尔·杜罗夫推出专注机密AI计算的去中心化网络Cocoon,或终结中间商垄断。它基于TON区块链,有三层架构,四步完成AI查询,但面临延迟和竞争挑战,未来将采用DAO治理。
CVPR2025视频生成统一评估架构,上交x斯坦福联合提出让MLLM像人类一样打分
Video-Bench视频评估框架由上海交通大学、斯坦福大学等团队提出,能让MLLM像人一样评估视频。它构建双维度评估框架,引入链式查询和少样本评分技术,突破现有评估方法限制,更全面智能地评分。