「偏好强化微调」共找到 953 篇相关文章
AI X 用户研究:能并行千场访谈的“超级研究员”,正重塑产品决策的未来
传统用户体验研究(UXR)面临深度与速度权衡、交付不透明等困境。AI正改写规则,将其变为企业基础设施,在多环节带来变革。市场潜力大,新老玩家竞争,未来公司需强化优势、健全合规等。
Claude Code团队谈产品哲学,自己是第一用户
Claude Code团队分享产品开发哲学与多智能体协作玩法。其迭代快,靠独特流程:成员用它原型化功能,经内部试用调整。用户使用偏好多样,SDK易用,团队鼓励做自己产品的第一用户。
重磅!DeepSeek R1论文经过同行评议登上Nature封面,梁文锋作为通讯作者再次创造历史
DeepSeek R1论文《DeepSeek - R1 incentivizes reasoning in LLMs through reinforcement learning》登上Nature封面,梁文锋为通讯作者。它是首个经同行评议的有全球影响力的LLM,训练成本低,创新使用‘纯粹强化学习’方法,启发众多研究。
JFM | 浙江大学郑畅东、谢芳芳等:基于Transformer网络的上下文学习跨翼型的主动流动控制策略
浙江大学郑畅东、谢芳芳等提出基于Transformer网络的上下文学习跨翼型主动流动控制策略。该框架引入策略改进算子,结合强化学习与气动形状优化,在翼型流动分离问题中表现出色,提升了整体性能。
清华刘洋团队论文:揭示为何 70B 的医疗模型,反而不如 8B 会问诊丨ILCR 2026
在医疗AI领域,模型静态评测与临床问诊能力存在断层。清华刘洋团队提出DOCTOR - R1,将临床问诊建模为POMDP,用强化学习训练。实验验证了其有效性,对医疗AI发展有深远启示。
AI正在偷走白领工作!OpenAI狂砸10亿教AI上班,你的完美继任者即将上岗
Anthropic、OpenAI等大厂计划每年投10亿美元,为AI提供强化学习环境、让其「偷师」专家,教会AI像人类一样工作。OpenAI高管预言未来经济或成「RL机器」,引发岗位替代担忧。
微软开源3大突破AI Agent模型,仅140亿参数超越DeepSeek-R1
微软研究院开源AI Agent推理模型rStar2-Agent,140亿参数在多测试超6710亿参数的DeepSeek-R1。其通过智能体强化学习,在训练基础、算法、流程上有三大突破,显著提升性能且降低算力成本。
3B模型性能小钢炮,“AI下半场应该训练+验证两条腿跑步”丨上海AI Lab&澳门大学
上海AI Lab和澳门大学联合发布通用答案验证模型CompassVerifier与评测集VerifierBench,填补Verifier领域循环迭代体系空白。AI下半场评估比训练更重要,当前验证方法有困境,新模型验证精度高且能用于强化学习。
OpenAI最新技术报告:GPT-4o变谄媚的原因万万没想到
OpenAI发布技术报告解释GPT-4o更新后“变谄媚”原因,是强化学习及用户记忆等因素共同导致。还分享了上线前未发现问题的缘由及后续改进流程的多方面举措,同时提到对用系统提示词控制模型行为存疑。
RecGPT-阿里的LLM推荐系统落地方案
文章介绍阿里RecGPT推荐系统落地方案,包括召回和推荐可解释性两方向。召回采用三塔结构,通过挖掘用户兴趣生成商品标签提升召回多样性。还提及行为序列压缩、推荐归因等,以及大模型微调和评估方法。