新闻资讯7
OpenAI:让AI学会「忏悔」自爆黑料
新智元
AI 摘要
OpenAI研究者提出「忏悔机制」,训练模型回答后自我报告是否违规。该机制让模型主动承认不良行为,提升可见性,虽处早期,但为AI安全训练提供新思路。
阅读原文 · 新智元
OpenAI这招太狠!AI从「躲猫猫」到「自爆黑料」,主打一个坦白
随着AI进入高风险场景,透明、安全变得重要。OpenAI提出「忏悔机制」,让模型回答后产出自我坦白报告,不影响主回答评分,只考察诚实,能提升不良行为可见性,目前仍处概念验证阶段。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
推荐文章8
前英伟达工程师:AI 终局是后台 Agent
前英伟达工程师、Sail Research 创始人 Neil Movva 认为当前 AI 行业陷“延迟陷阱”,AI 终局应是后台 Agent。他执行“算力拾荒者战略”,想降低智能成本,还指出 Transformer 架构有缺陷,互联网数据被吃光等问题。
AI科技大本营
新闻资讯8
OpenAI自研芯片性能超英伟达,2026年部署
8月25日,OpenAI公布自研推理芯片Jalapeño性能测试结果,首次给出其在多款公开大模型上的具体数据。该芯片在低功耗下实现高推理吞吐量和低延迟,性能超英伟达芯片,B0版已进入制造阶段。
DeepTech深科技
新闻资讯8
比尔·盖茨:AI已跨过临界点引担忧
比尔·盖茨在与《麻省理工科技评论》的采访中表示,AI在多方面已跨过临界点,但行业外缺乏讨论。他警告生物恐怖主义风险,提出‘人类保留岗位’、征税等政策设想,也看好AI在部分领域价值。
DeepTech深科技
新闻资讯7
Opus 5.1本周发布,AI智能体赛道将洗牌
消息称Anthropic本周将发布Opus 5.1,其升级聚焦单Token智能水平,强化编程、推理、AI Agent能力;OpenAI 10万亿参数模型Bel完成预训练;企业选模型‘够用就好’,Anthropic Fable 5份额低。
新智元