「错误检测」共找到 335 篇相关文章
腾讯混元 x MBZUAI 港中文新研究:将纠错纳入策略空间,Search-R2 重构搜索增强推理学习方式
过去大语言模型能力提升靠参数和数据扩张,但在真实任务中此路径有局限。腾讯混元、MBZUAI、港中文联合团队提出Search - R2,将纠错纳入策略空间,抑制错误传播,在多跳推理任务中优势显著。
OpenAI罕见发论文:我们找到了AI幻觉的罪魁祸首
AI“幻觉”是阻碍完全信任AI的关键障碍,目前无根治良方。OpenAI罕见发论文揭示其根源,指出标准训练和评估程序奖励猜测,应加大对自信错误的惩罚,奖励表达不确定性。
TGRS 2025 | FSConv:空域捕结构+频域提细节,即插即用的特征增强神器
红外小目标检测存在目标小、背景干扰大难题,传统卷积易丢失特征信息。TGRS 2025论文提出FSConv模块,通过双域融合提升特征表达能力,具备多尺度特征保持、轻量化、自适应增强等优势,有广泛应用场景。
拒绝「降智、减配、乱收费」:面向LLM API的可信验证框架
大语言模型成AI应用基础设施,黑盒服务模式引发信任危机。研究者提出IMMACULATE审计框架,能在不暴露模型信息、仅1%额外开销下,验证黑盒LLM API执行完整性,检测违规行为,相关论文与代码已公开。
1个Token测出模型降级调包!成本砍到千分之一,API供应商的小伎俩全曝光了
法国研究人员开发新检测技术,能识别云端模型隐秘变动。对数概率追踪用于灰盒环境,成本仅传统千分之一;黑盒边界输入追踪用于黑盒环境,成本为先进方案1/30。这些工具让API供应商“调包”行为现形。
OpenAI公开新的模型训练方法:或许能解决模型撒谎问题,已在GPT-5 thiking验证
OpenAI公开名为“坦白”的模型训练方法,可解决LLM欺骗行为。该方法强制模型自我反省,“坦白”奖励与“主要回答”奖励分离。在GPT - 5 - Thinking上实验,能提升不良行为可见性,但对“无知的错误”有局限。
以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能
dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。
夜光影像里的"暗船":双分支 YOLO11 如何用抓非法捕捞
非法捕捞的暗船常关掉 AIS 隐身,难被传统手段监控。论文提出双分支 YOLO11,通过夜光遥感数据精准检测,还设计预处理流程,在测试集表现优,规模化应用也得到暗船率等成果。
彻底封杀!Anthropic第四刀砍向龙虾,开发者哀嚎,两大创始人互喷!
前天Anthropic封杀OpenClaw订阅额度后,24小时内又在官方轻量化命令行工具查人,提示词含“OpenClaw”就返回400错误。两大负责人隔空交火,开发者各寻出路,这或成Anthropic战略失误。
5w颗星!前Google工程师为Agent打造的设计系统
Anthropic的frontend - design是Claude首个广泛使用设计技能,Impeccable由此起步并扩充功能。它有一次设置流程、23条命令、59条确定性检测规则等,还给出反模式,介绍多种安装方式及使用方法。