高考评测」共找到 649 篇相关文章

算法论文7

SOTA大模型遇上加密数据评测:Qwen3未破10%,o1也栽了丨上海AI Lab等联合研究

当前推理模型在基准测试中性能卓越,但在密码学领域推理能力待探索。上海AI Lab等推出CipherBank评测,用海量真实隐私场景数据和多类型密码算法挑战SOTA大模型,结果显示模型表现不佳,还分析了模型“犯难”原因。

量子位
产品应用7

从天价咨询到免费AI,夸克能改变志愿填报这门生意吗?

高考报志愿难题一直存在,天价咨询服务并非人人能享。夸克推出国内首个高考志愿大模型,免费生成志愿报告。它能理解复杂规则、把握考生需求,经多阶段训练优化,还搭载高考知识库,产品体验简便。

量子位
新闻资讯7

说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。

作者有感于AI在真实工作场景评测的稀缺性,以阿里国际站RealReplicaBench评测集为例,介绍电商场景任务,发现多数模型成功率低,其他领域类似,呼吁厂商努力,作者也计划自跑评测更新排名。

数字生命卡兹克
算法论文7

OpenAI谈:大模型为什么会有幻觉?如何避免?

OpenAI论文探讨大模型幻觉问题,指出评测缺陷,像多数AI模型评测非对即错,模型为得分会瞎猜。还从预训练和后训练阶段剖析根源,提议改造评测,引入置信度阈值和错误惩罚机制。

探索AGI
新闻资讯7

复读一年,AI 把高考数学成绩从及格线提到 145 分!AI 数学能力发生了什么?

今年媒体让AI做高考数学题,Gemini 2.5 Pro获145分排第一。从去年到今年,AI数学能力指数级增长,这得益于推理模型。推理模型用思维链和强化学习解题,未来高考数学或难区分模型能力。

宝玉AI
算法论文8

ICLR 2026 oral | AI代码真能进生产环境?SwingArena:从「写对代码Commit」到「通过CI审查」

过去一年大模型写代码能力提升,人们思考其能否参与软件工程核心流程。现有评测基准有缺失,SwingArena填补空白,将博弈引入评测,设计检索增强流水线,其开源后或成评估AI编程能力新工具。

机器之心
算法论文8

ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案

多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。

机器之心
开源动态7

开启Benchmark的Harness时代:15家学术机构联合发布HarnessEval

8月13日,DeepSeek开源Agent Harness dsh引发行业对“Harness”的关注。近日,MirroS联合多机构发布HarnessEval,将其概念引入评测系统。它使评测从Metric到Harness,形成可执行评测系统,已落地于交互式世界模型。

机器之心
算法论文8

AAAI 2026|视频大语言模型到底可不可信?23款主流模型全面测评来了

合肥工业大学与清华大学团队推出视频大语言模型综合可信度评测基准 Trust-videoLLMs,对 23 款模型从五维度 30 项任务评测,揭示性能格局,指出模型现存问题,还开源评测框架等。

机器之心
算法论文8

Auto-Research「终极大考」:新基准撕下大模型科研伪装

来自多所高校的研究者提出MLS - Bench,用于解决现有Auto - Research评测的归因问题。它含140个真实研究任务,校准受控修改范围,主实验显示当前模型在方法发现上有明显缺口,Auto - Research需更严格评测标准。

机器之心