Table30基准测试集」共找到 1182 篇相关文章

新闻资讯7

GPT-5基准测试泄露,被曝两天后发布?打Minecraft震撼开挂网友直呼封神

GPT - 5消息不断,泄露的基准测试及Minecraft实测惊艳网友。有爆料称7月31日发布,也有消息指8月。它或统一o与GPT系列,编码能力强,能处理复杂编程任务,不过也引发对其影响的担忧。

新智元
算法论文7

多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品

现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。

量子位
开源动态8

打破AI能力的惯性评估方式,红杉中国推出全新双轨基准测试xbench|甲子光年

红杉中国推出全新AI基准测试工具xbench,采用双轨评估体系,构建多维度测评数据集,追踪模型理论能力上限与Agent实际落地价值。还采用长青评估机制,首期发布两个核心评估集并给出综合排名,公开后邀各界完善。

甲子光年
算法论文8

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

香港中文大学(深圳)等高校联合腾讯发布 GameCraft-Bench,旨在构建基于真实游戏引擎、产物完整可运行且能验证的 AI 游戏生成评测基准,解决现有基准难衡量端到端可玩性的问题,测试显示前沿模型在游戏生成上仍薄弱。

AI科技评论
新闻资讯8

只有 30 个工程师的 X,是怎么重新杀回 App Store 第二的

本文讲述X产品负责人Nikita Bier的经历,他曾多次打造爆款App。加入X后,30人团队30天内将App Store排名从78推到2。他还分享X在算法、功能等方面的改进,以及Elon的管理风格和X未来计划。

宝玉AI
产品应用7

求稳的安全IP,安谋科技如何守正出奇?|甲子光年

12月24日,安谋科技推出新一代SPU IP——“山海” S30FP/S30P,给出面向高性能计算芯片的全栈安全解决方案。该方案从硬件IP层、软件中间件到云端服务构建一栈式安全防护体系,有五大核心亮点。

甲子光年
新闻资讯7

先验+后验加持,大模型能否 hold 住推理预测的现实「溢出」?

多数大模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,大模型在现实场景运用仍待优化。

机器之心
新闻资讯8

在ICLR 2026主会之前,我们和30多位入选者聊了聊最前沿的AI细节

4月14日,智源社区、DeepTech联合举办ICLR 2026预讲会。会议聚焦顶会核心精华,三十余位论文作者分享AI Agent、大语言模型等热门领域成果,展示解决大模型痛点的研究。

DeepTech深科技
产品应用8

QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5

通义文档智能团队推出QwenLong - L1.5长文本推理专家,提供端到端长文本推理后训练“配方”,含数据合成管线、强化学习方法、智能体架构,在多基准测试成绩佳,代码已开源。

机器之心
开源动态8

「世界理解」维度看AI视频生成:Veo3和Sora2水平如何?新基准来了

近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大学等团队提出新评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。

量子位