「检测方法评测」共找到 2246 篇相关文章
规模化人工判断:Dropbox 如何借助大语言模型优化 RAG 系统标注
为提升 Dropbox Dash 生成回复的相关性,工程师采用大语言模型辅助人工标注。该方案解决了纯人工标注的局限,通过人工校准大语言模型标注的方法,为 RAG 系统提供了有价值参考。
1美元Token撬动4800美元收益!AI挑战百万美元级基准,最赚钱的Agent出现了
Humanlaya Data Lab等机构构建$OneMillion - Bench评测基准,用经济价值衡量模型。它含400道高难题目,覆盖多领域。目前最强模型能产出约50万美元价值,但离可交付专业任务还有距离。
ICLR 2026|滑铁卢大学联合可灵提出UniVideo:统一视频理解、生成、编辑多模态
滑铁卢大学与快手可灵团队提出 UniVideo,是支持视频理解、生成与编辑的多模态模型。它采用双流架构,结合 MLLM 与 MM - DiT 能力,统一 10 个多模态任务,在多项基准超现有方法,代码已开源。
从代码基座模型到智能体与应用:代码智能的全面综述与实践指南
北航、阿里等机构联合发布论文,系统梳理 2021 - 2025 年代码大模型发展。介绍代码基座模型、评测任务、对齐技术等,还提及软件工程智能体、安全防御及训练指南,预言未来编程走向。
李飞飞押注的3D世界模型黑科技,被这篇论文一次性扒光!
李飞飞创业公司World Labs发布空间智能模型成果,推出Marble平台。本文分享3D、4D世界模型技术综述,系统梳理原生表示的世界模型,给出分层分类法、数据集与评测指标,并开源维护。
百川开源医疗增强大模型 Baichuan-M2:更符合中国临床诊疗场景,可 4090 单卡部署
百川智能发布并开源医疗增强大模型 Baichuan-M2,以更小尺寸反超 OpenAI 新模型。它可 4090 单卡部署,成本低,在 HealthBench 评测表现佳,免费开源,更适配中国临床诊疗场景。
多模态大模型,真的「懂」世界吗?——揭秘 MLLM 的核心知识缺陷
ICML 2025高分论文揭示MLLM核心认知盲区。研究发现主流MLLM缺乏核心认知能力,且不能靠规模扩展自然习得。作者构建测评体系CoreCognition,提出干预测试方法Concept Hacking,还给出关键发现与启示。
阿里达摩院开源多模态医学大模型—灵枢
大模型在医疗领域应用有医疗知识覆盖不足、幻觉风险高、推理能力欠缺三大难题。阿里达摩院开源统一多模态医学大模型灵枢,介绍其数据体系、清洗流程及四阶段强化训练方法。
思维锚点:破解LLM Reasoning黑箱的关键句
文章提出思维锚点概念,指推理轨迹中影响后续步骤和答案的关键句。开发三种归因方法,系统论证高级组织句影响力更大,锚点主导错误修正。研究为理解LLM推理机制开辟新途径,开源工具支持可视化分析。
5w颗星!前Google工程师为Agent打造的设计系统
Anthropic的frontend - design是Claude首个广泛使用设计技能,Impeccable由此起步并扩充功能。它有一次设置流程、23条命令、59条确定性检测规则等,还给出反模式,介绍多种安装方式及使用方法。