「多阶段推理系统」共找到 4041 篇相关文章
GPT-5.2考赢人类!OpenAI警告:大模型能力已过剩,AGI天花板不是AI
GPT - 5.2在ARC - AGI - 2基准测试超人类,Poetiq系统让其准确率从60%提至75%。OpenAI称大模型进入‘能力过剩’阶段,未来AGI进展不止靠模型,更需人机协同。
黄仁勋CES2026最新演讲:三个关键话题,一台“芯片怪兽”
北京时间1月6日,英伟达CEO黄仁勋在CES2026演讲。回顾过去一年开源模型发展,本次围绕系统与基础设施、模型、应用落地三条主线演讲,展示Rubin架构等成果,推动推理型AI发展及应用。
图灵也没想到,智能,必须在现实中「活」下来
第六届 ATEC 科技精英赛 ATEC2026 已开赛,由多单位共同组织。赛事聚焦人工智能、具身智能等方向,以真实世界挑战为命题,通过赛题设计检验系统在真实环境的运行能力,还设置丰厚奖励。
JustGRPO:扩散语言模型的极简主义回归
本文提出回归极简的方法 JustGRPO,在 RL 阶段让模型自回归生成,用标准 GRPO 训练,能超越各类针对 dLLM 设计的 RL 算法表现,提升推理表现同时保留并行解码能力。
阿里达摩院开源多模态医学大模型—灵枢
大模型在医疗领域应用有医疗知识覆盖不足、幻觉风险高、推理能力欠缺三大难题。阿里达摩院开源统一多模态医学大模型灵枢,介绍其数据体系、清洗流程及四阶段强化训练方法。
LLM的快速、慢速与工具增强思维模式综述
大型语言模型在不同任务中对推理策略需求差异大,策略选择不当会影响效率与可靠性。本文提出双重知识边界框架,梳理LLMs推理模式,将策略选择形式化,还分析了决策因素及策略选择机制。
以星为舵:LLM的Post-Train与Rest-Time奖励学习综述
这篇论文提出奖励信号像AI的“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期的三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。
基于Spring AI Alibaba 的 DeepResearch 架构与实践
本文基于 SpringAI Alibaba Graph 构建 Java 版 DeepResearch 系统,实现信息搜集到报告生成的全自动流程。介绍系统能力、架构、核心功能节点及技术点,还阐述 RAG、搜索、MCP、报告生成等功能,给出使用、部署和社区参与方式。
NVIDIA技术沙龙 《大规模EP优化:PD分离MoE并行方式》课程笔记
本文是NVIDIA技术沙龙课程笔记,介绍大规模EP优化的PD分离MoE并行方式。涵盖PD分离、大规模专家并行等五项关键技术创新,还对比多模型架构,展示推理服务架构性能特点与优化策略,以及各技术工作流程和效果。
卡奥斯奔赴港交所,工业AI开启新征途|甲子光年
中国工业互联网迎来智能化加速阶段,卡奥斯递表港交所,为观察工业智能走向产业基础设施提供了样本。它脱胎于海尔,已实现产业规模化落地并盈利,在中国基于平台的工业数据智能解决方案市场位居第一。