运行时学习」共找到 2442 篇相关文章

产品应用7

AMD服务器上一个诡异的性能问题诊断历程

本文复盘AMD服务器高优故障,从8月底起,集团amd turind机器业务cpi和cpu利用率飙升,影响业务性能。经排查是split lock问题,由python解释器调用__libc_free出错引发,还分析了问题原因、传导路径,并给出应对措施。

阿里云开发者
开源动态7

免费开源、可本地部署的AI私人助理Clawdbot,保姆级搭建教程来了

本文提供免费开源、可本地部署的AI私人助理Clawdbot的搭建教程。它能在多平台运行、连接工具和技能。教程涵盖创建虚拟机、安装Node.js和Clawdbot、设置连接等步骤,还介绍技能扩展和VPS运行方案。

AI寒武纪
开源动态7

LM Studio宣布支持在Mac上跑Qwen3-Next 80B模型

LM Studio宣布支持基于MLX框架在Mac上运行阿里Qwen3-Next 80B模型。该模型虽总参数量达800亿,但每次推理仅激活30亿。第三方评测显示其4bit量化运行效果好,不过实现GGUF格式支持尚需间。

AI工程化
算法论文8

英伟达揭示RL Scaling魔力!训练步数翻倍=推理能力质变,小模型突破推理极限

学界对强化学习能否让模型学会新推理技能争论已久,过去研究多悲观。英伟达研究指出,问题源于任务在基础模型训练数据中过度呈现及训练步数不足。其ProRL框架提升训练步数,释放小模型潜力,还构建技术组合拳。

机器之心
算法论文8

斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4

斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等大模型。论文解决了RL在代理环境中可变长动作优化偏差和稀疏奖励两大挑战,为AI代理发展指明方向。

深度学习自然语言处理
算法论文8

RL在Agentic Reasoning中的作用:拨开迷雾,看清本质

近年大语言模型在推理任务能力惊人,但使用外部工具存挑战。传统SFT无法让模型自主调用工具,强化学习虽被引入,但在智能体推理中面临训练效率、稳定性和泛化能力难题。论文从多维度解构智能体强化学习,提出有效方法。

深度学习自然语言处理
算法论文8

无需验证器的RL:RLPR解锁LLM通用推理潜能

现有依赖强化学习与可验证奖励(RLVR)提升大语言模型(LLM)推理能力的方法,受限于领域特定验证器。本文提出RLPR框架,利用LLM生成正确答案的固有概率作奖励信号,实现无需外部验证器的通用领域强化学习,效果显著。

深度学习自然语言处理
算法论文8

RL加持的3D生成代来了!首个「R1 式」文本到3D推理大模型AR3D-R1登场

强化学习首次被系统性拓展到文本到3D生成领域,上海人工智能实验室等机构研究者提出首个强化学习增强的文本到3D自回归模型AR3D - R1,还提出Hi - GRPO范式和MME - 3DR基准,实验显示其性能优异。

机器之心
产品应用8

文心X1.1三大能力狂飙,海内外实测还挺惊艳!

9日WAVE SUMMIT深度学习开发者2025大会上,文心大模型X1.1发布,事实性、指令遵循、智能体能力显著提升,多项测试表现佳。它能做到知识一致,精准遵循指令,智能体解决问题出色,代码、数学、多模态能力也有进化,得益于迭代式混合强化学习训练框架。

新智元
新闻资讯8

Karpathy 回应争议:RL 不是真的不行,Agent 还需要十年的预测其实很乐观

Andrej Karpathy 在与知名播客主持人 Dwarkesh Patel 的对谈中指出当下 LLMs 研究进展、Agents 存在的实际问题,如‘AGI 仍需十年间’‘LLM 认知有缺陷’‘强化学习很糟糕’等。他还对关键争议点做了补充回应,包括对 AGI 间线、强化学习局限性等的看法。

Founder Park