「同质化评估」共找到 1447 篇相关文章
ICLR 2026 Oral|多模态知识图谱对齐难:破解噪声关联至为关键
在数据多元化时代,多模态知识图谱能为下游应用提供数据支撑,实体对齐是构建知识图谱的核心技术。但大规模知识图谱关联与融合面临噪声和潜隐关联挑战。四川大学团队提出 RULE 方法,缓解了这些影响,论文被 ICLR 2026 接收为 Oral。
学术海报不用愁,一句话精准自动编辑,华东师大开源APEX
华东师范大学Planing Lab提出APEX框架,能通过自然语言指令实现学术海报局部可控编辑,引入「审查—调整」机制提升可靠性。还构建APEX - Bench评估,实验显示APEX优于其他方法。
AI 会取代你的工作吗?Anthropic 用 200 万对话告诉你答案
Anthropic发布Economic Index第四期报告,分析200万次Claude对话,提出“经济原语”框架。发现AI对高学历任务加速效果更好但成功率低,还揭示Claude.ai与API差异,引入“有效AI覆盖率”等。
上交博士最新思考:仅用两个问题讲清强化学习
上交博士 Kun Lei 博客提出用两个问题理解强化学习:数据从哪来、策略更新多频繁。借此梳理算法逻辑,还延伸到机器人基础模型,指出训练节奏与其实践契合。
NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了
大型语言模型推理延迟高、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难学 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。
颠覆AI Agent开发,一个容器搞定所有开发环境!
AI Agent开发环境配置复杂,开源项目AIO Sandbox将浏览器、终端等工具整合到Docker容器,形成统一沙箱执行环境。它有一体化沙箱等亮点,还提供多语言SDK,能一键启动。
The Batch: 871 | Mistral测量了大语言模型的能耗、水耗与物料消耗
法国AI公司Mistral发布对Mistral Large 2的环境分析报告,涵盖全生命周期影响。研究表明单次使用影响小,但累计负担大。虽研究有不足,但其方法或推动环保型AI发展。
AI编程「反直觉」调研引300万围观!开发者坚信提速20%,实测反慢19%
非营利性 AI 调研机构「METR」对 AI 编程工具影响开发者效率进行随机对照实验,结果意外:开发者本坚信提速 20%,实测却慢 19%。还分析了原因,指出调研局限与未来展望。
Google 2025年6月核心算法更新及应对,以及百度5月7月算法对比
Google发布2025年6月核心算法更新,预计3周完成。此次未透露方向,暂无针对性策略。还介绍了核心算法更新概念、近期更新情况、应对方法,对比了与企鹅算法差异,此外提及百度5月和7月算法对比及MCP协议。
Lovable 仅凭 35 个员工创造 8000 万美元 ARR 的原因
Lovable 仅35人7个月达8000万美元ARR,因其有大量 AI 原生员工。AI 原生员工默认用 AI,能快速解决问题。聘用此类员工可释放自主权、提升速度,传统公司转型难,未来组织将变革。