「迁移学习」共找到 1607 篇相关文章
给GRPO加上运筹外挂让7B模型比肩GPT-4!Li Auto团队发布多目标强化学习新框架 | ICASSP 2026
文本摘要质量评估需兼顾多维度,但开发者优化时易顾此失彼。Li Auto团队提出HVO,基于GRPO框架,让7B模型在摘要任务媲美GPT - 4,且生成内容更简洁,成果被ICASSP 2026接收。
Agentic RL训练:它不是单一 RL 算 法,而是一整套环境建模、学习信号、异步数据流、策略优化和基础设施的协同系统
文章指出Agentic RL训练不是单一算法,而是协同系统。它与传统RL不同,有四个训练变化。理解它要围绕三个不变量,还从环境建模等八个方面阐述,强调其竞争在于环境、信号、分布与系统的协同闭环。
ICLR 2026|在「想象」中进化的机器人:港科大×字节跳动Seed提出WMPO,在世界模型中进行VLA强化学习
香港科技大学 PEI - Lab 与字节跳动 Seed 团队提出 WMPO 新范式,可让具身智能在‘想象中训练’,解决传统 VLA 训练瓶颈,目前论文、代码与模型均已开源。
腾讯混元 x MBZUAI 港中文新研究:将纠错纳入策略空间,Search-R2 重构搜索增强推理学习方式
过去大语言模型能力提升靠参数和数据扩张,但在真实任务中此路径有局限。腾讯混元、MBZUAI、港中文联合团队提出Search - R2,将纠错纳入策略空间,抑制错误传播,在多跳推理任务中优势显著。
微软亚洲研究院机器学习组首席研究员刘炜清确认出席 AICon 深圳,分享由生成式基础模型驱动的金融市场仿真引擎
8月22 - 23日,首届AICon全球人工智能开发与应用大会深圳站将启。微软亚洲研究院刘炜清等专家将分享经验。刘炜清会介绍由生成式基础模型驱动的金融市场仿真引擎MarS,展示其在金融场景潜力。
生成视频总出物理bug?用VLM迁移+token级对齐,让燃烧在正确位置发生,碰撞遵循动量守恒丨CVPR 2026近满分接收
现有生成式视频模型多停留在“外观拟合”,未真正“物理建模”。中山大学等机构提出ProPhy,构建渐进式物理对齐框架,使模型有“分层物理理解”与“空间物理对齐”能力,论文被CVPR2026近满分接收。
AI产品先发优势在于用户迁移成本高,持续为用户提供价值是保持竞争优势的关键 | 对话AI智能电子衣橱工具搭搭
文章围绕AI智能电子衣橱工具搭搭展开,介绍其功能、开发逻辑与发展规划。搭搭通过AI算法筛选美图定义美,提供穿搭灵感,注重用户需求。团队投入研发,获客成本低,未来聚焦工具,解决穿搭问题,与用户共建产品。
科技赋能 未来已来 | 人形机器人训练中心探秘 @首钢园
文章探秘首钢园的人形机器人数据训练中心,提及机器人学习的情况,还列出了相关参考资料,展现科技赋能下人形机器人领域的发展。
7.3K Star!港大开源神作,集问答、可视化、出题于一身的 AI 超级导师!
香港大学 HKUDS 开源的 DeepTutor 是爆火的个人学习助手,集文档问答、可视化讲解、智能出题、深度研究于一体,解决自学痛点,还给出了快速入手步骤。
当面试官说「回去等通知」时,他们到底在等什么?
Chip Huyen的开源书《Machine Learning Interviews》被热议,其用200+道题拆解机器学习面试真相,指出多数人挂在三环节。书还摊开不同岗位考察点,建议关注解题路径,还给出资源指路。