大模型测试」共找到 9635 篇相关文章

开源动态8

国产类脑模型适配国产沐曦GPU!长序列推理提速超百倍,仅用2%数据匹敌主流模型

中国科学院自动化所李国齐、徐波团队发布类脑脉冲模型SpikingBrain (瞬悉)-1.0,借鉴脑信息处理机制,适配国产沐曦GPU,长序列推理提速超百倍,仅用2%数据匹敌主流模型,探索构建国产自主可控类脑模型生态。

量子位
算法论文7

正确答案 ≠ 正确推理,CoT 或成模型推理能力停滞的「罪魁祸首」?

研究指出当前模型推理能力评估多关注答案准确性,忽视推理步骤。通过对前沿模型测试发现,2023 - 2024 年模型推理能力提升停滞,进步靠提示工程,自底向上策略最有效。

AI科技评论
算法论文8

世界首个!李飞飞团队推出物理推理基准,模型统统不及格?

斯坦福联合中科团队推出世界首个评估视觉语言模型物理推理能力的基准QuantiPhy,通过测试发现顶尖模型在数值计算上不如人类,还揭示模型推理靠记忆而非测量,为AI发展指明方向。

AIGC开放社区
算法论文7

模型追逐星辰海,GPT和Gemini国际天文奥赛夺金

新论文以国际天文学和天体物理学奥林匹克竞赛 (IOAA) 为基准测试,证明 GPT - 5 和 Gemini 2.5 Pro 能在天文奥赛获金牌。研究还分析不同模型表现、与人类成绩对比及错误类型,强调需全面评估模型科研潜力。

机器之心
推荐文章7

数据到好猜想:如何用模型做市场研究?

文章指出模型重塑用户需求调研,并非按常规用AI获取和清洗数据,而是让模型扮演真实用户。以品牌分析社交媒体数据为例,探讨数据局限,还介绍‘好猜想’标准,最后说明Atypica.AI能构建消费者智能体解决归纳问题。

Founder Park
算法论文7

模型在具身推理上「翻车」了?4496 道题全面揭示短板

美国东北学等提出BEAR基准评估MLLM具身智能子能力,用4496道题测试20个模型。发现多模态模型具身能力不足,还分析错因,开发BEAR - Agent提升模型具身推理能力,在仿真测试中效果显著。

机器之心
推荐文章8

别再迷信模型!吴恩达亲授AI秘籍:小模型+边缘计算=财富密码

吴恩达指出,AI创业真机遇不在模型,而在智能体。智能体市场潜力,创业者可发挥其专业化优势。还建议忽略AGI,用AI解决日常问题,关注小模型边缘计算、军民两用场景,构建可信AI应用。

新智元
算法论文8

模型转行土木工程!首个「打灰人」评估基准:检验读、改工程图纸能力

首个工程自动化任务评估基准DrafterBench,可测试模型在土木工程图纸修改任务中的表现。它模拟真实工程命令,考察模型四方面能力。评测发现主流模型有一定能力,但未达工程一线要求。

新智元
推荐文章7

模型是不是到顶了?瓶颈到底在哪

文章探讨模型是否到顶,指出‘到顶’争论分三个问题,靠堆模型提升能力之路变平,受数据和成本约束。但模型还有后训练和推理时计算两个发展方向,未来进步或来自更会用算力。

AI Reading Hub
产品应用7

卡帕西模型横评方法太好玩了!四AI匿名参赛评分,最强出乎意料

卡帕西发布“模型议会”web app,系统通过OpenRouter调起多模型开会商议,各模型答题、互评、排序,由主席模型给出统一答案。可对比模型差异,模型自评与人类主观或不同,多模型集成或成突破点。

量子位