「人工智能评估」共找到 1182 篇相关文章
OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低
OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。
GPT-5、Grok 4、o3 Pro都零分,史上最难AI评测基准换它了
AAI机构提出新基准FormulaOne,让GPT - 5、o3 Pro等前沿大模型集体得零分。该基准含220个图结构动态规划问题,分三类难度。测试结果显示,模型在深层及最深层难度表现差,引发关注。
MSSP | 西北工业大学马启悦,高传强等:融合激波位置的跨声速抖振气动载荷辨识
本文提出融合激波位置的跨声速抖振气动载荷辨识方法,从时序流场提取激波特征,用稀疏辨识构建参数化代数方程,增强预测精度与泛化能力,为准确预测跨声速气动载荷提供新思路。
英伟达市值突破4万亿美元!特朗普将在白宫接见黄仁勋
今天凌晨CNBC消息,英伟达CEO黄仁勋将很快在白宫与特朗普见面。此前英伟达市值首破4万亿美元成全球最高。但它因美出口管制陷入困境,芯片销售损失巨大,后续出口或再受限。
DeepMind 再放大招,AlphaGenome 能一次性处理百万碱基对,基因组里的“垃圾代码”这下藏不住了
Google DeepMind发布AI模型AlphaGenome,可预测遗传变异对基因调控的影响。它能处理百万碱基对,结合关键技术,性能顶尖,还能直接建模RNA剪接点,已面向非商业研究开放,引发医疗AI应用讨论。
如何选择最佳多模态大模型压缩方案?哈工大、度小满开源EFFIVLM-BENCH基准测试框架
金融科技智能化转型中,LVLM部署受算力瓶颈制约。哈工大与度小满联合开源EFFIVLM - BENCH基准测试框架,能为多模态大模型压缩方案出具‘体检报告’,还揭示LVLM加速复杂性,推动技术发展。
比自回归更灵活、比离散扩散更通用,首个纯Discrete Flow Matching多模态巨兽降临
近年来多模态大模型多采用自回归架构,推理缺乏灵活性。香港大学和华为诺亚方舟实验室研究团队提出FUDOKI,基于全新非掩码离散流匹配架构,能并行去噪、动态修正,为多模态模型开辟新路径。
GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题
上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。
无需 OCR 就能从各类文档中提取结构化信息的本地化开源工具docext
docext是无需OCR的本地化开源工具,能从发票、护照等文档图像提取结构化信息。智能文档处理排行榜评估VLMs在多任务表现,docext有灵活提取、表格提取等功能。
北大DeepSeek论文或预定ACL Best Paper!梁文锋署名
北大DeepSeek联合发布的NSA论文已被ACL 2025录用且评分高,有望冲击最佳论文。该技术革新传统注意力机制,提升算力效率,是长文本处理的突破。此外,张铭教授团队还有多篇论文上榜。