「细粒度对齐」共找到 252 篇相关文章
我们正处在「AI设计下一代AI」的黎明!Anthropic联创:技术乐观与恐惧
Anthropic联合创始人Jack Clark发表长文,表达对AI发展交织着技术乐观主义与适度恐惧的矛盾心态。他指出AI似真实神秘生物,既会快速发展覆盖多领域,也会因目标与人类偏好不一致而行为奇怪。
Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃
大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。
说句话就能飞!北航发布语言交互的无人机控制模型
北航刘偲教授团队提出语言引导的细粒度无人机轨迹控制研究框架,定义Flow范式。采用模仿学习法让无人机响应指令,构建数据集和仿真评测基准,还提出协作策略和算法,实现真机部署。
这一次,真不是狼来了,旧时代一夜终结「GPT-6 Astra与特斯拉Cybercab同日上线」
OpenAI总裁称迎来AGI时代。GPT - 6 Astra实现前所未有的对齐,理解意图大幅提升,能快速完成电脑上的事。投资人实验中,它用一句话构建微型文明。同日特斯拉Cybercab提供出行服务,旧时代或终结。
大厂的AI不限量补贴终会结束!Hermes Agent作者:开源框架真正的狠招是把Claude对Anthropic的忠诚抢过来
科技创作者 Peter Yang 对话 Hermes Agent 作者之一 Karan Malhotra,探讨 Hermes Agent 与其他产品的差异、模型谄媚问题、开源意义等。Karan 指出其独特自我改进系统与专注用户需求特点,还提及让模型更贴合用户的方法。
Claude杀入全美教室:一周干49小时的老师,终于等来免费AI助教
7月14日,Anthropic推出Claude for Teachers,向全美K - 12教师免费开放高级能力与教学技能库,接入50州课标。它能完成备课对齐、差异化分层、数据分析等工作,不碰学生端,定位是帮老师减负。
谷歌最新发表的Science论文,颠覆了人类对ASI的想象
谷歌等机构研究者在《科学》发文,提出真正智能爆炸已发生,是多元、社会性且与人类深度缠绕。推理模型内部涌现‘思想社会’,当下人机协作进入‘半人马时代’,还探讨了AI扩展、对齐及治理问题。
北大王选所彭宇新团队:让多模态大模型学会「看懂物种关系」丨CVPR 2026
北大王选所彭宇新团队在论文中提出TARA方法,引入生物分类学知识与多模态模型中间表征对齐。实验显示,TARA能提升模型层级识别和未知类别识别能力,还可加速训练收敛,计算开销小。
大模型哪里出问题、怎么修,这篇可解释性综述一次讲清
来自多机构的研究团队发布“可实践的机制可解释性”综述,通过 'Locate, Steer, and Improve' 三阶段范式,为大模型的对齐、能力增强和效率提升提供方法论,还梳理可解释对象体系和干预手段。
AI 产品范式探讨:非线性思维、多 Agent 协作才是复杂任务的更优解
本文探讨AI产品范式,指出当前大模型产品设计多将其视为‘万能单兵专家’,但复杂任务下效果不佳。提出群体智能、非线性思维等观点,阐述人机协作方向,介绍新范式及AI产品商业化核心是信任。