强化学习训练」共找到 3132 篇相关文章

算法论文8

建模世界偏好:偏好建模中的Scaling Laws

研究首次揭示人类偏好建模遵循Scaling Law,从论坛收集数据在Qwen 2.5模型训练,发现测试损失随训练规模指数增长线性下降。提出建模世界偏好,论文和模型已开源,还探讨了偏好建模可扩展性等问题。

通义千问Qwen
开源动态8

DeepSeek-V3.2正式版发布,将开源模型的能力推向极致

DeepSeek-V3.2正式版开源,包含标准版和Special版。它采用稀疏注意力机制,降低计算复杂度。后训练阶段有多项算法改进,支撑高难度推理。还融合思考与工具使用,合成训练数据,在智能体评测表现优异。

AIGC开放社区
算法论文8

缺数据也能拿SOTA?清华&上海AI Lab破解机器人RL两大瓶颈

现有机器人视觉 - 语言 - 动作(VLA)模型训练范式存在数据采集成本高、泛化能力不足等问题。清华和上海AI Lab团队提出SimpleVLA-RL,解决了VLA模型训练的核心瓶颈,在多基准测试中实现SoTA性能。

量子位
算法论文8

机器人的「GPT时刻」来了?丰田研究院悄悄做了一场最严谨的VLA验证实验

丰田研究院(TRI)团队研究大型行为模型(LBM),在近1700小时机器人数据上训练并大量部署评估。发现LBM性能提升显著,预训练小数据量也能带来增益,预示机器人通用大模型或到来。

机器之心
推荐文章9

快去提问!沐神空降小红书,在线答疑

本文整理了深度学习大牛李沐(沐神)在小红书开展的AMA答疑内容,覆盖AI学习、职业方向、技术趋势、行业赛道等大众关心的热门问题,给出了直白干货的回答,适合AI从业者、学生参考。

机器之心
算法论文8

2篇最新Anthropic论文,揭开LLM对齐新范式

Anthropic在5月连发两篇研究,揭示LLM对齐训练新范式。指出单纯模仿正确行为不足以保证安全,需在预训练与对齐微调间插入教原理阶段。研究围绕Claude模型展开,有多项关键发现,MSM方法效果显著。

PaperAgent
算法论文8

阿里通义发布并行计算新策略:1.6B等效4.4B,内存消耗骤降95%

阿里通义团队提出PARSCALE并行计算新策略,受CFG双路径推理机制启发,将并行思想扩展到训练和推理全流程。能让1.6B模型性能接近4.4B模型,内存占用大降,还可用于现有模型,无需从头训练

量子位
算法论文8

LoRA中到底有多少参数冗余?新研究:砍掉95%都能保持高性能

这篇创新研究介绍了LoRI技术,证明即使大幅减少LoRA的可训练参数,模型性能依然强劲。研究团队在多个任务上测试了LoRI,发现仅训练LoRA参数的5%,LoRI就能匹配或超越其他方法的性能。

机器之心
产品应用7

这家公司刚成立7个月,正在打磨通用具身智能的终极形态

超维动力(Kinetix AI)于2025年7月注册,9月研发,不足一年便举办独特发布会,让KAI人形机器人“自己发布自己”。其认为高拟人是训练强世界模型前提,构建了含本体、世界模型等的技术体系,但面临工程与成本挑战。

机器之心
算法论文8

ACL'25最佳论文解读 | 大模型也会‘弹簧回弹’?揭秘 LLM 对齐的脆弱根源

本文分享 ACL 2025 最佳论文,指出预训练大模型存在‘抗对齐’的 Elasticity 现象,即对齐微调只是暂时拉伸,后续微调会让其迅速弹回预训练分布。研究量化该概念,用‘压缩理论’刻画对齐并实验验证。

PaperAgent