「幻觉评估」共找到 918 篇相关文章
结构化预处理让DeepSeek准确率提升51%,现已开源丨清华&深言
零成本降低大模型幻觉新方法LingoEDU,让DeepSeek准确率提升51%。它对上下文精准切分,形成篇章结构树。能解决现有方案两难困境,在多方面实验表现出色,有根治幻觉等核心价值。
上科大何旭明团队新作:克服简单样本偏置,让多模态模型学会「难题优先」
上海科技大学何旭明团队针对多模态模型幻觉问题,提出DA-DPO框架。该方法不依赖额外人工标注,通过动态调整样本权重,缓解简单样本偏置,在降低幻觉率同时提升综合能力,具成本效益。
告别AI胡说八道,Meta新方法CoVe准确率飙升 28%
大模型‘幻觉’问题一直是‘严肃使用场景’的难题。Meta AI团队提出CoVe新方法,让大模型学会‘自我反省’。该方法通过四步走实现自我纠错,能大幅降低幻觉率,还具备三大优势。
让大模型基于「图像事实」说话:用事实文本+自适应编辑,让语言偏见无处遁形丨ICLR'26
多模态大模型看图常“脑补”,存在对象幻觉问题。北航团队提出AFTER框架,含FAS和QAO模块,能在主流LVLM和基准上显著降低幻觉,且推理开销低,为多模态助手落地提供实用路径。
超越DeepSeek-R1,数学形式化准确率飙升至84% | 字节&南大开源
字节跳动Seed团队与南京大学联合发布CriticLean框架,将数学自然语言到Lean 4代码的形式化准确率从38%提升至84%。该框架创新性地将评估模型置于核心,解决语义对齐等问题,还构建了相关基准测试和数据集。
鹅厂实习生血泪贴:Agent/RAG黑科技,真相竟是这样!
腾讯实习生分享鹅厂项目实战经验,介绍Agent/RAG黑科技。先讲RAG原理、优化方法及评估流程,还提及文档解析;再阐述智能体定义、历史、原理、分类、评估框架与实践案例,助读者快速入门。
Notion、Stripe 都在用的 Agent 监控,Braintrust 会是 AI-native 的 Datadog 吗?
当 Agent 迈向产品化,开发者面临观测、评估和优化黑箱系统的挑战。Braintrust 由 Ankur Goyal 于 2023 年创立,重塑 Observability,提供 Eval 和 Ship 模块,获多家头部公司青睐与投资。文章从多方面剖析其能否成 Agent 时代‘新 Datadog’。
OpenAI研究大模型对GDP贡献,三大行业已能代替人类,并自曝不敌Claude
OpenAI推出新评估方法GDPval,跟踪模型在现实任务表现。评估显示前沿模型接近专家水平,Claude Opus 4.1表现最佳,GPT - 5准确性出色。还发布黄金子集和评分服务,其处于起步阶段将持续扩展。
GPT‑5深夜发布:模型之战结束,Agent之战开始!
昨晚,炒作一月的GPT - 5正式发布,标志原生Agent时代到来。体验显示其压低幻觉、提升指令遵循与推理能力。文中还对比了GPT - 5、Gemini、Claude等模型在不同场景表现,指出御三家路线分化及三条反常识判断。
评测也很酷,Data Agent 自动化评测的三层框架与实战
在大模型技术飞速发展下,评估应用效果成难题。字节跳动尹小明分享自动化评测技术,提出三层评测框架,还介绍 Text - to - SQL 及深度研究评测改进,以及评估平台建设,最后展望自动化评测未来方向。