协同强化学习」共找到 1843 篇相关文章

新闻资讯7

理想汽车内部会曝光:必做人形机器人!全网急聘“最好的人”、连跳槽的前员工都要揪回来?

1月26日理想汽车CEO李想召开全员会,强调2026年是AI头部公司上车最后一年,最晚2028年L4落地。理想会强化具身智能定位,必做人形机器人,还将对研发组织变革,官网已放出相关研发岗位。

AI前线
推荐文章8

从数据到决策:AI 驱动的 Quick BI 架构设计与实践

阿里云智能集团瓴羊高级技术专家王璟尧,介绍阿里云 Quick BI 从传统 BI 到 AI 驱动的智能 BI 的进化,解析领域大模型与 BI 引擎协同设计等技术权衡,为行业提供可复用技术范式。

InfoQ
算法论文8

让大模型学会「自己教自己」!京东&中科院信工所连发三篇论文定义Self-Taught RLVR

京东和中科院信工所开展Self - Taught RLVR系列研究,连发三篇论文。从RLSD、NPO、CoPD三个维度探索让大模型自我指导。如RLSD解决信息泄漏,NPO引入有效学习信号,CoPD整合多专家能力,各有创新与良好效果。

量子位
推荐文章7

24小时快速入门大热语言Rust!学不会来找我

文章从Rust核心语法等基础入手,介绍其不同于其它语言的思维方式,还通过实战项目带读者入门。阐述了安装、工具使用,用greplite小程序介绍语言特点,讲解组织数据方式、所有权等,最后实现mini - redis并给出学习建议。

腾讯技术工程
算法论文8

T-PAMI|中国科大、合工大等提出CAPER++:让关节物体位姿感知真正迈向「又快又稳」

在具身智能发展下,关节物体位姿感知难题待解。中国科大、合工大等团队提出 CAPER++ 框架,从关节驱动视角建模,将位姿学习拓展至 SE (3) 流形切空间,实现端到端推理,兼顾精度、鲁棒性与实时性。

机器之心
开源动态8

写Verilog、调CUDA,总翻车?工业代码大模型开始学会「先想后写」了

工业代码大模型缺的往往是‘想’的能力。北航联合多家单位提出的InCoder - 32B Thinking,让模型结合工业环境思考,通过ECoT从错误中学习,用ICWM提前预判结果,还能自适应思考深度,且模型与代码已开源。

机器之心
新闻资讯8

GAIR 2025 大会首日:AI重构教育、科学与产业的十三重碰撞

2025年12月12日,第八届GAIR全球人工智能与机器人大会在深圳开幕。众多顶级学者围绕AI对教育、产业等领域的影响发表演讲与讨论,如赵伟院士提出高校“加减替换”培养模式,贾佳亚教授认为大模型将走向“感知机器+终身学习”模式等。

AI科技评论
算法论文8

总成本降低30倍,告别昂贵后训练,在线策略蒸馏敲开大模型后训练的未来

明星公司Thinking Machines由前OpenAI首席技术官联合创立,其研究团队提出在线策略蒸馏的LLM后训练方法。该方法结合在线策略训练与蒸馏优势,解决后训练两难困境,成本降30倍,还为持续学习和个性化打开新大门。

AIGC开放社区
算法论文8

Thinking Machines新发现:Lora不是权宜之计,哪怕秩低到 1,也能匹敌全参数微调

Thinking Machines和John Schulman新研究刷新对LoRA的认知,实验显示正确使用时它能匹敌全量微调。团队系统研究训练集与参数关系,有层选择、学习率等关键发现,还给出实用建议,但LoRA在部分场景表现待验证。

AI工程化
新闻资讯8

硅谷今日最热具身模型!不用后训练,看一遍就学会

北美具身初创Skild AI发布全新机器人基础模型S1,主打上下文学习,能看示范视频完成复杂操作。在未见过任务上成功率达66%,远高于传统方法。其发展或让开发机器人技能像给ChatGPT写Prompt。

量子位