数学基准」共找到 1177 篇相关文章

开源动态8

真实科研水平集体不及格!全新基准SFE给主流多模态LLM来了波暴击

上海人工智能实验室AI4S团队推出SFE评测基准,首创三级评估体系,涵盖五大科学领域66项任务。评测显示主流MLLMs在高阶科学任务有挑战,不同模型、学科表现有差异,还构建了SciPrismaX平台推动AI科学评估生态发展。

机器之心
算法论文8

迈向原生全模态AI智能体:人大&小红书发布OmniGAIA新基准

中国人民大学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能体发展方向。

PaperAgent
新闻资讯8

啊?微博7800美元训的大模型,数学能力超了DeepSeek-R1

近日,微博发布自研开源大模型VibeThinker,15亿参数却在数学测试上击败6710亿参数的DeepSeek R1,后训练成本仅7800美元。其为AI产业带来新思考,还将推动微博AI应用发展。

量子位
产品应用7

我让10个大模型又参加了完整版数学高考,第一名居然是它。。。

作者让10个大模型参加完整版数学高考,单独制定规则,邀朋友协助测试。结果令人意外,单选题第6题成噩梦,多模态题大模型几乎全军覆没。讯飞星火和豆包145分并列第一,Qwen3屈居第三。

数字生命卡兹克
开源动态8

真实评估!北理发布全球首个「全场景教育」基准,支持4000+情境

北京理工大学高扬老师团队推出EduBench,是全球首个「全场景教育」基准,涵盖9大教育场景、12个评估维度、超4000个情境。团队将数据、模型等全面开源,评估发现大模型在特殊教育场景有不足,还提出多源知识蒸馏等方法。

新智元
新闻资讯7

GPT-5攻入数学圈,证明定理快过博士生?网友热议AI新角色

9月初,arXiv一篇论文将GPT - 5写进数学研究成果。它解决了第四矩定理‘收敛速度’的空白,还在凸优化领域提升收敛界限。不过它常犯错,需人类引导,且成果原创性存疑,引发对科研和博士培养的担忧。

新智元
新闻资讯7

数学圈地震!o3靠直觉刷爆人类顶尖难题,14位专家集体破防

Epoch AI新研究发现,o3 - mini - high能破解顶尖数学难题,具备渊博学识且会基于直觉解题,但推理风格依赖直觉,缺乏严谨性和创造力,还存在投机取巧、幻觉等问题。

新智元
开源动态8

CrowdStrike联手Meta发布AI安全基准,让AI在真实网络攻击中证明自己

美国网络安全巨头CrowdStrike与Meta在Fal.Con 2025大会联合推出开源基准测试套件CyberSOCEval,旨在评估AI大语言模型在真实SOC环境下的网络安全能力,它源于Meta之前框架,开源供全球开发者使用。

AIGC开放社区
新闻资讯7

高考数学斩获139分!小米7B模型比肩Qwen3-235B、OpenAI o3

2025高考落下帷幕,人工智能领域多家大模型挑战数学卷。小米7B参数的MiMo - VL模型考139分,比肩Qwen3 - 235B、OpenAI o3,还在多方面表现出色,技术报告等已开源。

机器之心
新闻资讯8

陶哲轩再爆:一个月三破18年未解难题!AlphaEvolve彻底改写数学研究规则

一项封尘18年的数学难题,在短短30天内被AlphaEvolve与人类联手三度突破,和差集指数θ从1.173050提升至1.173077,刷新加法组合学天花板,展示了AI与人类协作的新范式。

新智元