「Self - Aligned Reward」共找到 65 篇相关文章
Evolvent AI 胡梦康:Agent 可能会被模型吃掉,但帮助 Agent 进化不会
Evolvent AI 创始人胡梦康认为 AI 下一阶段是让模型自主迭代。公司搭建 Self - Evolving Agent Infrastructure,希望成 Agent 进化的数据基础设施供应商。胡梦康分享研究历程、对 Agent 方向判断及公司业务,探讨 Agent 数据等问题。
规范对齐时代:GPT-5 断层领先,让安全与行为边界更明晰
上海交通大学等团队提出规范对齐概念,构建评测基准 SpecBench 评测 33 个主流模型,发现多数模型有不足。还探索测试时深思方法,如 Align3 能提升规范遵循度,GPT - 5 在规范对齐上断层领先。
ACL 2025 | 大模型乱试错、盲调用?KnowSelf让智能体有「知识边界感知」能力
ACL 2025 论文《Agentic Knowledgeable Self-awareness》聚焦提升智能体「知识边界感知」能力。KnowSelf 方法让智能体自主调节知识运用,实验显示其性能优,还探索了智能体自我认知多方面影响。
CVPR'26 | 以机器人为中心的ToM推理框架,从心智推理到决策行动
吉林大学、台湾大学和微软亚洲研究院联合提出MindPower Benchmark,构建以机器人为中心的ToM推理框架,统一建模环境感知、心智推理等,还构建数据集和评估指标。引入Mind - Reward强化优化,提升ToM决策与动作生成性能。
OpenAI:人&AI对齐技术应该是一个动态、双向的循环
在NeurIPS 2025上,NYU&OpenAI就Human - AI Alignment发布Tutorial。指出当前对齐像打地鼠,根源是将其当成静态、单向的,提出HAA框架,强调多元目标、人类全链路话语权及社会 - 技术系统量化监督。
比Transformer更强的架构来了?浙大新作Translution,一统卷积和自注意力
随着大模型发展遇瓶颈,浙大等校学者提出神经网络基础操作Translution,实现自注意力与卷积的融合统一,构建更普适神经计算机制。它性能超Self - attention,为新一代神经网络发展开辟新方向。
规范对齐:回答前的深思,让安全与行为边界更清晰
OpenAI等厂商将规范融入大模型。上海交大等团队提出规范对齐概念,构建评测基准SpecBench,揭示主流模型不足。探索测试时深思方法,如Align3,能提升模型规范遵循度,项目已开源。
ACL2025 | 传统符号语言传递知识太低效?探索LLM高效参数迁移可行性
中科院自动化所谭宇乔等研究跨规模大模型参数知识迁移(PKT)可行性。指出传统符号语言传递知识低效,LLM 模仿此范式也有局限。提出新 Pre - Align PKT 范式,实验分析 PKT 效果,揭示神经不兼容性致其失败。
GPT-6 或有"生命"!MIT新作实现LLM自我进化,冻结权重时代终结
MIT新作《Self-Adapting Language Models》实现LLM自我进化,SEAL框架让模型自己生成“自编辑”微调自身。它能实时学新数据、修复知识、形成记忆。经两种场景验证,小模型也能超越GPT - 4.1等。
一篇最新自演化AI Agents全新范式系统性综述
传统LLM Agent工作流固化,面对动态环境只能人工硬编码,成本高、迭代慢。此55页综述提出“Self - Evolving AI Agents”新范式,让Agent自主优化自身结构,还给出三定律、统一框架及各类优化方法。