数学推理测试」共找到 3512 篇相关文章

产品应用8

火山引擎 veFuser:面向扩散模型的图像与视频生成推理服务框架

近年来扩散模型在图像和视频生成领域取得突破,但 DiT 模型推理面临计算量大、模型多样、实时性需求等挑战。火山引擎推出 veFuser 推理框架,能在图片和视频生成上实现低延迟、低成本的高质量体验,且未来会持续迭代。

InfoQ
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。

PaperAgent
推荐文章8

万字长文!大模型(LLM)推理优化技术总结(非常详细)

文章聚焦大模型推理优化技术,介绍推理过程分预填充与解码阶段,还阐述模型并行、注意力机制优化、模型优化及服务技术等,如多查询注意力减少内存,FlashAttention 优化计算顺序。

AINLPer
算法论文8

大模型训练新突破!“不对称”训练让AI学会自我反思,推理零开销

字节团队提出全新语言模型训练方法PCL,首次打破训练与推理对称约束,实现‘训练-推理不对称’。在训练时让模型反思评估结果,推理时仅输出答案,零额外开销,显著提升模型能力。

量子位
开源动态8

Andrej Karpathy 盛赞!斯坦福团队新作,让Llama-1B 实现毫秒级推理

斯坦福Hazy Research团队将开源模型Llama - 3.2 - 1B前向推理整合为“Megakernel”,把推理延迟大幅降低,显存带宽利用率显著提升。团队指出当前主流LLM推理系统在小batch、极低延迟场景下低效,提出Megakernel以重构执行方式。

AI科技评论
开源动态8

妈妈再也不用担心延迟了!斯坦福手搓Llama超级内核,推理仅需0.00068秒

斯坦福Hazy实验室推出低延迟推理引擎「Megakernel」,将Llama - 1B前向传播融入单一GPU内核,H100上提速1.5倍,B200上每次推理仅0.00068秒,比vLLM快3.5倍。文章分析传统引擎问题并介绍Megakernel设计。

新智元
推荐文章7

AICon上海演讲精华回顾:《GMI Cloud 全球化高性能分布式推理服务构建实践》

AICon2025上海站,GMI Cloud资深架构师Frank Lee分享《GMI Cloud全球化高性能分布式推理服务构建实践》,介绍其推理平台,拆解扩缩容等能力,分享架构设计、部署及优化实践,揭秘推理提效关键路径。

InfoQ
开源动态8

具身智能迎来ImageNet时刻:RoboChallenge开放首个大规模真机基准测试

近日,RoboChallenge推出全球首个大规模、多任务真机基准测试。它构建开放、公正、可复现的‘真实考场’,为视觉 - 语言 - 动作模型提供评估标准,推动具身智能发展,还提供远程测试服务等。

机器之心
产品应用8

大模型推理的“左右脑”革命!华为盘古Embedded凭昇腾之力,让快慢思考合二为一

传统大模型推理面临长链条深度思考与低时延反馈的矛盾,华为盘古团队提出盘古Embedded模型。基于昇腾NPU,其采用双系统认知架构,集成“快思考”与“慢思考”双推理模式,实现推理效率与精度协同提升。

机器之心
算法论文7

DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了

过去两年大模型推理能力跃迁,谷歌等机构研究指出,推理能力提升源于模型推理时隐式模拟类多智能体交互结构“思维社会”,还提出利用“群体智慧”新方向,并介绍了研究方法、实验结果等。

AINLPer