「论文新颖性评估」共找到 1642 篇相关文章
打破资源瓶颈!华南理工&北航等推出SEA框架:低资源下实现超强多模态安全对齐
本文介绍北航彭浩团队的 SEA 框架,针对多模态大模型低资源安全对齐难题,用合成嵌入替代真实数据,突破资源瓶颈。还构建 VA - SafetyBench 评估安全风险,实验验证了 SEA 低资源、高泛化优势。
33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形
ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。
一张图生成「能动」的3D资产:VAST+香港大学AniGen把AIGC推向动画、游戏、仿真与具身智能 (SIGGRAPH 2026 TOG)
SIGGRAPH 2026论文AniGen,由VAST和香港大学研究,能从单张图片直接生成带骨架与蒙皮权重的可动画3D资产。它解决了现有方法的不足,在多方面表现出色,对多个领域意义重大。
GPT-5.1 突然发布,用户实测:更像 4o,情商大幅提升
OpenAI 向部分付费用户推送 GPT - 5.1,有即时思考和深度思考两种模式,系统自动匹配。它有八种人格预设,改进不仅在语气,还提升记忆编织等能力,像是补救 GPT - 5 失败,还扩展安全评估。
香农、信息论、AI、Scaling Law,以及信息的观察者效应
文章围绕经典信息论在AI实践中的矛盾展开,介绍CMU和NYU论文《From Entropy to Epiplexity》提出的新概念,解释合成数据、数据排序等问题,还探讨合成数据飞轮能否持续,指出epiplexity可定义数据质量。
大模型训练新突破!“不对称”训练让AI学会自我反思,推理零开销
字节团队提出全新语言模型训练方法PCL,首次打破训练与推理对称约束,实现‘训练-推理不对称’。在训练时让模型反思评估结果,推理时仅输出答案,零额外开销,显著提升模型能力。
「0污染」LLM理解基准来了!20000道题14个学科全覆盖,来自微软
MMLU-CF是微软亚洲研究院推出的无污染多任务语言理解基准测试,含20000道题、覆盖14学科。通过去污染规则和闭源测试集防数据泄露,保证评估结果可靠,已在Huggingface开放。
R1时代,RAG-Retrieval技术总结与展望~
RAG - Retrieval提供全链路RAG检索模型微调、推理及蒸馏代码,支持多模型、多loss和训练方式。还发布模型技术报告,设计评估框架,未来探索RL在检索领域应用。
DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案
DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。
一文搞懂 Agents 评测丨Anthropic 最新万字长文
传统模型评测方法难评估 Agent 系统,Anthropic 摸索出有效评测设计方法。文章介绍评测结构、意义、方法,涵盖编程、对话等 Agent 评测,还给出打造评测路线图及与其他方法结合的建议。