「运动控制算法」共找到 1066 篇相关文章
承包你的品牌营销物料|谷歌再发重磅 AI 设计产品
谷歌实验室发布AI设计产品Pomelli,专注帮企业低成本生成符合品牌调性的营销物料。它能提取官网品牌元素创建DNA卡片,依此生成设计稿,还能微调细节。不过,它依赖官网信息,存在美学单调等问题。
DPO与GRPO谁更胜一筹?港中文、北大等联合发布首个系统性对比研究
港中文、北大等团队首次全面对比DPO和GRPO算法在自回归图像生成中的应用,评估其在域内、域外性能,探究奖励模型及扩展策略的影响,为开发高效RL算法提供新思路。
五份专利曝光,长文拆解特斯拉V3灵巧手技术路线
特斯拉Optimus人形机器人量产计划因灵巧手难题被搁浅。4月16日,世界知识产权组织公布其第三代灵巧手5项专利,文章从整体构型、前臂、手腕等方面拆解其技术路线,各部分紧密协作,体现系统思维。
DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危
据爆料,DeepSeek计划在2月中旬春节前后发布V4模型,剑指编程王座。其在编程能力、超长上下文代码处理、算法提升、推理能力上有突破,或延续高性价比路线,在受限硬件下靠算法取胜。
Light-X来了!全球首个「镜头×光照」双控4D视频生成框架,单目视频秒变电影级
新加坡南洋理工大学等科研机构联合推出Light - X,全球首个「镜头×光照」双控4D视频生成框架。它解耦相机与光照,在扩散模型中融合,还构建Light - Syn数据管线,实验显示其效果显著优于现有方法。
人形机器人「网球运动员」来了!不靠预编程,银河通用×清华破解长程打网球难题
银河通用与清华联合提出LATENT研究,使人形机器人通过深度强化学习自主习得网球对打能力,实现从“机械复刻”到“智能决策”跨越。该研究提出新运动学习方法,构建“运动小脑”等,经实验验证性能优越。
RL在Agentic Reasoning中的作用:拨开迷雾,看清本质
近年大语言模型在推理任务能力惊人,但使用外部工具存挑战。传统SFT无法让模型自主调用工具,强化学习虽被引入,但在智能体推理中面临训练效率、稳定性和泛化能力难题。论文从多维度解构智能体强化学习,提出有效方法。
你不知道的 Agent:原理、架构与工程实践
文章聚焦 Agent 架构中影响工程效果的关键内容,如控制流、上下文工程等。介绍 Agent 基本运转方式、控制模式,强调 Harness 比模型更关键,还阐述上下文工程、工具设计、记忆系统等要点,并以 OpenClaw 为例说明落地方法。
DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO
文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。
JCP | 浙江大学边鑫等:基于 PINNs 的非结构自适应网格细化:面向稳态流动的残差驱动 AMR 新方法
本文提出利用控制方程残差引导网格细化的启发式策略,用物理信息神经网络(PINNs)整合粗网格数据与控制方程。通过解决流动问题并与传统方法对比,显示该策略能平衡计算精度与成本,但有额外计算开销。