算法论文8
社交Agent思维切换超GPT - 4
深度学习自然语言处理
AI 摘要
论文指出大模型思维单一,研究团队受分层认知控制理论启发,设计4种思维模式,用AMPO算法动态切换。在模拟社交任务中,AMPO任务成功率高、效率提升,思维模式分布灵活。
阅读原文 · 深度学习自然语言处理
社交Agent: 通过RL学习自适应Thinking,根据场景在“秒回”和“深思”间灵活切换
现有聊天机器人在人情世故场景表现不佳,论文指出大模型思维‘一根筋’。研究团队设计4种思维模式,用AMPO强化学习算法动态切换。在模拟社交任务中,AMPO表现超GPT - 4,省时高效。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
具身智能:告别通用模型,走向异构编排
当VLA、WAM等机器人控制策略在各自任务中表现出色,如何为子任务匹配合适策略成完成复杂长时序任务关键。RoboHarness解决异构策略协同难题,通过协同调用策略提升成功率。
机器之心
产品应用7
Cursor:每家应用公司都应训自己的模型
今年5月,Cursor推出Agentic编程模型Composer 2.5,相比前代能力更强、成本效率更高。Cursor研究负责人认为最强大的RL环境就是自己的产品,文中还介绍了Composer 2.5训练方式、面临的挑战及解决办法等。
Founder Park
算法论文8
DYPO:让SFT与RL协同提升大模型推理
在大模型推理能力增强研究中,SFT和RL两种后训练范式难有效融合。研究团队提出DYPO动态策略优化方法,先判断样本学习阶段再匹配优化路径,在多场景实验中表现出色,不过有实验边界。
量子位
新闻资讯8
AI Spot 分享会聚焦 ICLR 2026 深度推理
当大模型走向深度推理,ICLR 2026 汇聚全球顶尖成果。OpenMMLab 等联合发起 AI Spot ICLR 2026 学术分享会,5 月 14 日 19 点直播,聚焦模型‘慢思考’,嘉宾将解读四大核心技术。
OpenMMLab