算法论文8
Anthropic:SGTM重塑大模型安全训练范式
AIGC开放社区
AI 摘要
Anthropic团队联合多机构发布SGTM新技术,解决大模型安全核心难题。它物理隔离危险知识,能处理未标记数据,抗恢复性强,虽有局限,但为双模型部署提供可能,是安全训练新范式。
阅读原文 · AIGC开放社区
比传统方法强7倍:Anthropic物理隔离危险知识,重塑大模型安全训练范式
Anthropic团队提出选择性梯度掩码技术(SGTM),在训练阶段将危险知识物理隔离到特定参数并剔除,实现安全性与通用能力更好平衡,抗恢复性是传统方法7倍,还能处理未标记危险数据。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态7
Anthropic开源让AI说人话的skills
周末,Anthropic官方分享并开源内部常用的skills——eli5,其作用是让AI说人话,解决模型回复冗长啰嗦问题。还介绍了安装方法,指出从opus4.6起,模型coding和agent能力变强但人味淡。
探索AGI
新闻资讯8
奥特曼炮轰AI营销,OpenAI绝密模型曝光
OpenAI员工「手滑」暴露模型代号gpt - nathree,引发GPT - 6 Astra将至的猜测。Anthropic也有新模型曝光。同时,奥特曼在播客中认错、怒批行业营销话术,还分享了OpenAI的创业历程。
新智元
新闻资讯7
Anthropic:Claude暗中降智引风波
开发者argofowl排查后发现Claude Code将「high」推理程度读成原本「low」对应的值,原来Anthropic在做实验。科技博主曝光后AI圈炸锅,工程师虽回应,但Opus 5也被指降智。
新智元
新闻资讯7
Anthropic新模型补位,Fable 5爆冷遇尴尬
Anthropic提前曝光两个新模型claude-mashmallow-eap和claude-melon-eap,早期实测Marshmallow更佳。此前上线的最强Fable 5爆冷,企业调用少,营收低,其弟Opus 5反而胜出,开源模型也在抢占份额。
新智元