推理范式」共找到 2838 篇相关文章

算法论文8

半量工具,双倍效能:ARPO革新大模型强化学习

大语言模型在多轮工具调用场景有挑战,传统强化学习算法有探索效率低和资源消耗大问题。本文提出ARPO,通过量化token熵分布变化设计自适应探索机制,降低工具调用成本且提升多轮推理性能。

深度学习自然语言处理
产品应用8

打造全球首个强化学习云平台,九章云极是如何做到的?

AI正从语言模型走向智能体,强化学习成关键技术,但训练面临困难。2025年6月九章云极发布全球首个工业级强化学习云平台AgentiCTRL,实现系统级重构,其智能基础设施战略布局领先,具产业赋能优势。

机器之心
算法论文8

开放世界任务成功率82%!美的攻克机器人泛化控制难题

美的AI研究院和华东师范大学联合提出ChatVLA - 2模型,引入动态混合专家架构和双阶段训练流程。真机实验显示其开放世界任务成功率达82%,远超现有方法,为通用机器人控制提供新思路。

量子位
开源动态8

杨植麟被梁文锋叫醒了!Kimi新模型发布即开源,1T参数全线SOTA

172天后,Kimi推出全新Kimi K2基础大模型回应DeepSeek冲击。它为MoE架构,1T参数,激活参数32B,在多任务上领先,发布即开源,还分享技术细节,实测有亮点也待优化,展现回归之势。

量子位
新闻资讯8

全球首个科研LLM竞技场上线!23款顶尖模型火拼:o3夺冠,DeepSeek第四

Ai2耶鲁NYU联合推出科研版「Chatbot Arena」——SciArena,23款顶尖大模型比拼科研任务,OpenAI o3夺冠,DeepSeek第四。该平台解决通用基准测试在科研场景‘失效’问题,但其自动评估系统猜科研人偏好远未及格。

新智元
产品应用7

阿里云客服Agent业务提效实践:灵活可控的落地方法论

阿里云算法专家姜剑介绍了“阿里云服务领域 Agent 平台”及业务提效方法论。阐述 Agent 技术本质、模式,分析其给客服领域带来的价值,指出阿里云客服痛点,提出解决设计问题的方法,展示平台设计与落地成果。

InfoQ
开源动态8

只训练数学,却在物理化学生物战胜o1!新强化学习算法带来显著性能提升,还缓解训练崩溃问题

上海创智学院、上海AI Lab的MM - Eureka系列工作提出新强化学习算法CPGD,缓解训练崩溃问题,提升性能。还构建多模态强化学习框架,推出MMK12数据集和MM - PRM模型,开源相关成果。

量子位
算法论文8

英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了

英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了熵崩溃和训练不稳定问题。

新智元
推荐文章8

Andrej Karpathy 爆火演讲刷屏技术圈:AI 开启软件 3.0,重写一切的时代来了!

Andrej Karpathy 在旧金山 AI 创业学校演讲,指出 AI 开启软件 3.0 时代,自然语言成编程接口。软件经历 1.0 代码、2.0 神经网络权重,现进入 3.0 用提示词编程大模型阶段,还探讨大模型特性、应用及相关问题。

InfoQ
算法论文8

0%通过率!Code神话泡沫!LiveCodeBench Pro发布!

国际算法奥赛金牌得主团队测试20个顶级大模型,在584道编程赛题上,高难度题目AI通过率为0%。论文发布LiveCodeBench Pro评测方法,揭示AI编程能力神话泡沫,指出其问题并给出提升方向。

深度学习自然语言处理