基准测试集」共找到 2446 篇相关文章

开源动态8

GraphRAG 和 DeepSearch于一体的智能问答系统graph-rag-agent

本项目结合GraphRAG与私域Deep Search,实现可解释、可推理的智能问答系统。亮点有从零复现GraphRAG、创新融合DeepSearch等,具备多模块功能,还有简单演示,地址https://github.com/1517005260/graph-rag-agent/blob/master/readme.md。

GitHubStore
新闻资讯7

一口气齐老黄苏妈英特尔,还得是AI,还得是联想

CES 2026上,各大厂商行动显示所有设备将成AI设备,有「物理AI」等新趋势。联想团杨元庆提出混合AI是推动AI普及的终极路径,联想还发布相关产品,展现其在AI生态的优势。

量子位
产品应用7

BrowseComp等评测第一,秘塔推出「深度研究」,已开启免费公开访问

世界变化快,AI领域新概念不断。秘塔在上线“浅度研究”五个月后,将其升级为“深度研究”。该模块最初由OpenAI推出,秘塔版可免费公开访问,准确率优,还让研究过程可见。

深度学习自然语言处理
算法论文8

首个GUI多模态大模型智能体可信评测框架+基准:MLA-Trust

MLA-Trust 是首个针对 GUI 环境下多模态大模型智能体的可信度评测框架,构建了涵盖四核心维度的评估体系,对 13 个模型深度评估,揭示可信度风险,还提供评估工具箱,推动其可靠部署。

机器之心
开源动态7

一键式训练端到端Agent,Qwen3+MCP工具高效成!

RLFactory是开源的端到端RL后训练框架,将环境与RL后训练解耦,有极致易用、高效训练等特点。它让用户专注奖励逻辑和工具配置,还能提升训练效率,用Qwen3和MCP工具可快速训练DeepSearch模型。

GiantPandaLLM
产品应用7

快手可灵也吃上了香蕉,一通离谱prompt测试,好好玩要爆了

ChatGPT发布三周年,快手可灵AI视频「O1模型」登场,号称“全球首个统一多模态视频模型”。实测显示它能一站式搞定视频修改、镜头延展等操作,还推出了图片O1模型,在图片生成方面表现出色。

量子位
算法论文8

测试时Scaling或是最大错觉,Google:R1/O1强推理另有原因

Google 112 页论文实证,OpenAI 的 o 系列等模型推理能力提升并非仅因计算时间延长,而是源于对复杂互动的隐式模拟。通过三重验证表明推理能力跃迁或因‘吵得更凶’,而非‘算得更久’。

PaperAgent
开源动态8

从第一性原理出发的RAG推理新范式来了,蚂蚁DIVER登顶权威基准

当前RAG系统处理多步逻辑推理任务有局限,蚂蚁团团队提出DIVER框架解决推理密型检索难题。它将检索任务分四阶段,在BRIGHT榜单领先,行业对比优势明显,医疗应用效果好。

机器之心
新闻资讯8

MLLM体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞

当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。

新智元
新闻资讯7

让ChatGPT连读“A”,直接崩溃到念广告词,网友:拿付费用户做测试呢?

ChatGPT付费用户体验高级语音模式时遇怪事,正常聊寿司时突然插播广告,连读“A”也会如此。网友猜测是广告插入或“幻觉”,OpenAI技术人员称是幻觉,而国产AI无此问题。

量子位