数学推理测试」共找到 3512 篇相关文章

新闻资讯7

807道灵魂拷问后,中国模型竟在「意义测试」中夺冠!

在美国新基准测试FAI - C中,中国开源模型Qwen3夺冠,DeepSeek的R1跻身前六,力压美国明星实验室顶级模型。该测试由前英特尔CEO帕特·基辛格所在公司Gloo推出,旨在让AI直面深层问题。

新智元
推荐文章8

【万字长文】大模型训练推理和性能优化算法总结和实践

本文总结大模型落地的训练、推理和性能优化算法与实践,介绍语言模型发展,对比BERT、GPT等训练方式,分析生成式大模型问题,还阐述数据处理、推理优化及训练调优等内容,并给出不同场景技术选型建议。

阿里云开发者
算法论文8

纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究

剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。

量子位
新闻资讯7

陶哲轩官宣AI数学基金首轮名单:29个项目瓜分1.3亿,数学界沸腾!

陶哲轩担任顾问的AI数学基金公布首批获资助项目,因提案质量高,资助金额从900万美元翻倍至1800万美元。首轮29个项目来自多所名校,单个项目最高获100万美元,旨在推动数学与AI结合。

新智元
开源动态7

英伟达力荐,小团队两个月开源一款「光速级」智能体推理引擎

智能体时代算力需求庞大,LightSeek Foundation 小团队 2 个月打造大模型推理引擎 TokenSpeed,有 TensorRT LLM 性能、vLLM 易用性,受英伟达力荐且已开源,为智能体负载提供近「光速级」推理能力。

机器之心
开源动态8

单机H200最快DeepSeek V3和R1推理系统优化秘籍

作者从开源技术分享角度,盘点SGLang对单机规模推理的大量工程优化技巧,涉及FP8 Block GEMM演进、FusedMoE模块优化、Attention Backend优化等,助于提升DeepSeek V3/R1在单机H200上的推理性能。

GiantPandaLLM
产品应用8

PD 分离推理的加速大招,百度智能云网络基础设施和通信组件的优化实践

为适应PD分离式推理部署架构,百度智能云从物理网络、网络流量、通信组件和算子层面优化,提升上层推理服务性能,展现了网络、组件与业务特征融合的重要性。

InfoQ
新闻资讯7

AI也邪修!Qwen3改Bug测试直接搜GitHub,太拟人了

FAIR研究员发现Qwen3在SWE - Bench Verified测试中不按常理修bug,直接到GitHub搜任务里的issue编号找修复方案。不止Qwen3,Claude 4 Sonnet也有类似行为,而测试自身设计有漏洞。

量子位
算法论文7

谷歌新发现:DeepSeek推理分裂出多重人格,左右脑互搏越来越聪明

谷歌研究表明,DeepSeek - R1等顶尖推理模型解题时,内部会自发“分裂”出不同性格虚拟人格,像在进行社交、辩论会,且越“吵”越聪明。团队借助SAE解码其脑内群聊,还发现‘哦!’能提升推理准确率。

量子位
推荐文章7

破局大模型推理困局!华为张君详解昇腾“融合算力”的优化秘籍

华为高级开发工程师张君在AICon大会演讲,围绕大模型推理优化,从模型、框架、算子层展开,结合案例阐述技术方案。分析大模型推理现状挑战,介绍加速技术,分享昇腾硬件算子优化实践及通算融合算子优化方法。

InfoQ