「跨形态动作对齐」共找到 683 篇相关文章
加速近5倍!北大与字节团队提出BranchGRPO,用「树形分叉 + 剪枝」重塑扩散模型对齐
北京大学与字节团队提出 BranchGRPO 新型树形强化学习方法,通过在扩散反演中引入分叉与剪枝,解决扩散/流匹配模型人类偏好对齐难题。该方法在图像与视频生成任务中表现优异,迭代时间最高近 5 倍加速。
阿里新开源提出建设性安全对齐方案,向“让用AI的人安全”新范式跃迁
阿里巴巴集团安全部联合多高校发布技术报告,提出建设性安全对齐理念并集成到Oyster - I模型。该理念突破传统防御式机制,构建新博弈框架,实验显示该模型在安全和通用能力上达SOTA水平。
银河通用LDA定义全域数据利用范式,跨本体世界动作大模型开启具身GPT-2时刻
当下具身智能赛道两大流派各有短板,银河通用推出跨本体「隐式世界 - 动作基础模型」LDA - 1B,走自研WAM路线,成果已开源。它打破数据割裂难题,解锁具身智能「GPT - 2时刻」,在多方面展现优势。
北大 & 作业帮团队提出 Text-to-SQL 新框架 Interactive-T2S,攻克宽表处理与低资源对齐难题
北大与作业帮联合研发的论文提出 Interactive-T2S 框架,将 LLM 塑造成智能代理,通过多轮交互解决传统 Text-to-SQL 方法在宽表处理、低资源对齐等方面的难题,已入选国际顶会 CIKM2025。
让机器人看视频学操作技能,清华等全新发布的CLAP框架做到了
近日,清华联合星尘智能、港大、MIT提出 CLAP 框架,能将视频运动空间与机器人动作空间对齐,解决‘数据饥荒’‘视觉纠缠’等问题,可让机器人从视频学技能,还缓解知识迁移难题,推动机器人产业化。
1句话高质量生成游戏3D动作,北大新方法刷新动画制作SOTA
北京大学提出ReMoMask:基于检索增强生成的Text - to - Motion框架,集成三项关键创新。在标准基准测试上,相比RAG - T2M,在HumanML3D和KIT - ML上FID分数分别提升3.88%和10.97%。
机器人“狂踹不倒”视频刷屏!太空舱遍布城市街巷,银河通用这几手秀麻了
银河通用发布全新通用动作追踪框架Any2Track,让机器人精确模仿人类动作,还能抗干扰。团队将动作捕捉学习解耦为两阶段,兼顾精准模仿与抗干扰。其银河太空舱让机器人融入生活,全栈自研技术推动具身智能落地。
黄仁勋罕见发长文:APP形态或将消失
英伟达CEO黄仁勋发表长文,系统阐释AI产业底层逻辑,定义AI“五层架构”。他指出AI产业尚处早期,潜力待发掘,未来还需巨额投资完善基础设施。还预判传统软件和 APP 形态或消失,AI Agent 将成主流。
Agent 形态一天一个样,Infra 到底该为谁而建?
过去一年,Agent 应用形态多变,但进入稳定生产环境的项目有限。清程极智师天麾认为,Agent Infra 重要性待显,当前应提高 Token 生产交付效率。还探讨了 Agent 发展问题、Token 相关指标及收费模式等。
360发布全球最强视觉语言对齐模型!榜单全面领先!
360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据集上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。