「基准测试集」共找到 2446 篇相关文章
人大-清华-腾讯发布:音频 - 视觉多模态任务统一框架
人大、清华和腾讯合作发布Crab论文,目标是实现多模态场景理解任务的高效一统。它针对音频 - 视觉理解模型难点提出解决方案,构建数据集、设计LoRA结构、统一架构,训练分预训练和指令调整两阶段。
编程能力开源SOTA,网络安全提升2倍!智谱发布GLM-5.3
智谱发布GLM-5.3,743B参数模型,编程能力达开源SOTA。网络安全能力涌现,基准得分是GLM-5.2两倍多。全部提升来自后训练缩放,还自研Z.ai Code Bench评估,安全评估加固后权重将开源。
GPT Image 2研究科学家陈博远:我在OpenAI修中文
GPT Image 2发布引发AI圈震动,主力训练者陈博远分享幕后故事。他和奥特曼同台主持,修好中文渲染,给模型起代号“布基胶带”,还设计多种“彩蛋级”测试,抖出官网图片幕后花絮。
分割一切、3D重建一切还不够,Meta开源SAM Audio分割一切声音
Meta 深夜放出音频分割模型 SAM Audio,可通过多模态提示分离任意声音。其核心 PE - AV 推动性能领先,还发布评测模型、基准等,整合进新平台,虽有局限但为音频 AI 带来新可能。
Meta开源史上最强语音“基座模型”:一口气支持1600+种语言
Meta AI FAIR团队发布Omnilingual ASR模型套件,能为超1600种语言提供自动语音识别能力。它引入新架构提升性能,改变引入新语言范式,还发布相关数据集和模型,与全球伙伴合作。
微软开源新版Phi-4:推理效率暴涨10倍,笔记本可运行
今天凌晨微软官网开源Phi - 4家族最新版Phi - 4 - mini - flash - reasoning,它参数小性能强,适合边缘设备。采用自研SambaY架构,推理效率涨10倍,延迟降2 - 3倍,多场景测试表现优异。
GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”
智源研究院发布国产开源统一图像生成模型OmniGen 2.0版本。它增强理解与生成能力,打通多模态生态。玩法简单,技术有创新,还引入反思机制和新基准,推理效率提升,且将全面开源。
智源新出OmniGen2开源神器,一键解锁AI绘图「哆啦 A 梦」任意门
2024年9月智源研究院发布统一图像生成模型OmniGen,获社区好评。近期OmniGen升级为OmniGen2,增强多方面能力且全面开源。它采用新架构与策略,有反思机制,玩法丰富,还推出新基准优化部署。
GPT-4o连验证码都解不了??SOTA模型成功率仅40%
MetaAgentX团队推出Open CaptchaWorld平台,用于测试Agent解验证码能力。实测SOTA多模态模型成功率低,如GPT - 4o也被难住。该平台特点多样,揭示了当前Agent短板及模型设计新方向。
ICML 2026|让AI自动发现前沿风险:创智×复旦×牛津发布AutoControl-Arena
当AI智能体走向真实应用,前沿风险藏于复杂长尾场景,难以靠人工覆盖。创智、复旦、牛津联合发布AutoControl Arena框架,自动合成可执行测试环境,还构建X - BENCH验证,已在GitHub开源。