后训练策略」共找到 4346 篇相关文章

算法论文7

无需准确传感信号!轻松搞定「多段软体机械臂」复杂位姿与形状控制

研究人员提出利用双向循环神经网络(biLSTM)的MSCA规划与控制策略,即便用不准确内部传感信号也能完成任务。实验显示该方法在多任务中表现优异,未来还将做进一步研究。

新智元
产品应用7

小哥硬核手搓AI桌宠!接入GPT-4o,听得懂人话还能互动,方案可复现

国外小哥Matthieu Le Cauchois受皮克斯台灯机器人启发,手搓AI桌宠Shoggoth,接入GPT - 4o,能与人互动。它结构简单可复现,采用低级和高级控制层,策略经仿真和真实环境验证有效。

量子位
算法论文7

机器狗能当羽毛球搭子了!仅靠强化学习从0自学,还涌现出类人回位行为 | Science子刊

苏黎世联邦理工学院团队让机器狗靠强化学习学会打羽毛球,开发全身视觉运动控制策略,使其最高挥拍速达12米/秒,还涌现类人回位行为,研究证明足式机器人在体育场景应用可行。

量子位
推荐文章7

DeepSeek-R1发布100天:全面复盘推理大模型复现研究及未来!

推理语言模型(RLMs)发展显著,DeepSeek - R1发布引发广泛影响且未完全开源。MiroMind等总结其复现研究,关注SFT和RLVR方向,介绍数据构建、方法设计、训练过程细节及实验关键发现。

PaperAgent
推荐文章7

任务自适应 Harness:从 Trace 到多 Coding Agent 的协作记忆

作者为AI Coding准备的端到端方案未落地,在Routa项目找到新落点。基于ACP协议的Agent Trace可记录关键行为,用于分析优化。还介绍了Feature Explorer、Kanban Harness及任务自适应Harness,探讨多Agent协作记忆。

phodal
算法论文8

静态稀疏已死:Flux Attention 开启长文本 LLM 自适应推理新时代

文章指出长上下文LLM高效推理面临性能与效率难题,先介绍Elastic Attention打破静态稀疏桎梏,重点阐述全新的Flux Attention,它将动态稀疏注意力范式升级为层级别路由,解决了算法与硬件的矛盾,在多方面实现突破。

深度学习自然语言处理
产品应用8

手撕Sora,脚踢Veo!13个行业实战案例,Seedance 2.0玩法大全

本文是藏师傅对 Seedance 2.0 的测评和教学,介绍其 API 春节将上线火山引擎,支持全模态输入。通过 13 个行业实战案例展示该模型能力,如生成广告、宣传片、教学视频等,还提及 Agent 自动化应用。

歸藏的AI工具箱
产品应用8

准确率提升至 90%,阿里商旅基于 AgentScope 构建多智能体差旅助手最佳实践

阿里商旅依托阿里巴巴生态,旗下AliGo差旅助手可实现业务闭环。早期单智能体模式有瓶颈,基于AgentScope构建多智能体系统,从技术选型、架构设计等多方面优化,事项收集准确率提至90%+,还解决诸多问题并获奖。

阿里云开发者
开源动态7

LightLLM中DeepSeek V3/R1 Two MicroBatch Overlap 实现解析

文章围绕LightLLM中DeepSeek V3/R1的Two MicroBatch Overlap实现展开。介绍了该技术原理,通过拆分推理过程、精心设计执行顺序实现计算与通信重叠。还阐述了数据结构设计、预处理、核心执行流程,以及优化策略和配置启用方式。

GiantPandaLLM
产品应用7

Claude写完代码不直接交了:4个Skill自查一遍,改好再找你

Anthropic将AI验收纳入循环,让Claude写完代码进行四道检查才交付,定义了验证循环,Claude Code团队有4个自查Skill,还介绍了写验证Skill的方法、触发设置,AI编程竞争正从生成转向验证。

新智元