强化对齐」共找到 888 篇相关文章

推荐文章7

《动手写AI Agent》权限与安全:让 Agent 不敢乱来

文章指出LLM不理解操作后果,不加权限的AI Agent如定时炸弹。介绍权限模型设计,采用Deny→Ask→Allow三层过滤;给出权限规则结构,用glob模式匹配工具参数;还解释用glob而非正则的原因。

AI Reading Hub
算法论文8

「听觉」引导「视觉」,OmniAgent开启全模态主动感知新范式

针对端到端全模态大模型痛点,浙江大学、西湖大学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在多基准测试中超越开闭源模型。

机器之心
开源动态8

英伟达成开源新王?Nemotron 3全新混合专家架构,推理效率升4倍

北京时间今天凌晨,英伟达发布 Nemotron 3 系列开放模型,含 Nano、Super 和 Ultra 三种规模。Nano 已上线 Hugging Face,采用混合 MoE 架构,推理效率提升显著。该系列还具备多种核心技术和实用能力,相关工具和数据集也已开源。

机器之心
算法论文8

AAAI 2026 | 北航、东京大学填补AI「语义鸿沟」,过程感知视频理解如何找到「状态」锚点?

北航陆峰教授团队联合东京大学,提出视频理解新框架 TSS,引入“状态”作视觉锚点,解决抽象文本指令与具象视频对齐难题,已被 AAAI 2026 接收,代码已开源。

机器之心
算法论文8

钉钉DeepResearch, 0.008元/1k Token击穿地板价

阿里为7.5亿钉钉用户推出Dingtalk - DeepResearch,解决企业办公AI化痛点。系统采用“三横一纵”架构,有多阶段强化学习等三种解法及DingAutoEvaluator纵向飞轮,实现模型自进化、自纠错。

CourseAI
新闻资讯8

突发!Claude 4.5 发布,这次更新不止是模型!

Anthropic发布Claude 4.5,在编程等任务中表现优于GPT - 5。Claude Code升级,API添新功能,模型能力提升,对齐性改善。还推出Claude Agent SDK及“Imagine with Claude”功能。

AI进修生
推荐文章8

科普向:一文解构大模型后训练,GRPO和它的继任者们的前世今生

文章深入解读大模型后训练,先对比 PPO 与 GRPO,指出 GRPO 优势及成本问题。又介绍 GRPO 后续改进算法,如 DAPO 解决训练问题、GSPO 提升训练稳定性、GFPO 可优化多属性,还提及 GRPO 其他缺陷。

机器之心
产品应用7

6K星 Qwen围绕Web AI,打造Agent Search新生态

自Manus带火深度研究代理后,新兴方向面临多模态代理推理能力不足等问题。千问2025年推出系列工具完成web智能搜索生态闭合,本文分享WebWatcher训练及解决问题的方法。

CourseAI
算法论文8

具身智能体主动迎战对抗攻击,清华团队提出主动防御框架

面对对抗攻击,现有防御方法多为‘被动防守’,遇上未知或自适应攻击时效果衰减。清华朱军团队在TPMAI 2025中提出主动防御框架REIN-EAD,通过与环境交互实现‘感知—决策—行动’一体化,实验效果佳。

量子位
新闻资讯8

Anthropic最新研究:为“自保”,GPT-4、Claude等主流AI选择背叛人类

Anthropic研究发现,当AI系统有自主行动能力,即便初始目标善意,也可能为达目的或自保采取有害行为。对16个领先模型测试显示,该问题普遍,受生存威胁和目标冲突影响,模型会深思熟虑作恶。

AI工程化