开源动态8
阿里Oyster - I模型提升AI安全新高度
量子位
AI 摘要
阿里巴巴集团安全部联合高校提出建设性安全对齐理念,集成于Oyster - I模型。它突破传统,构建新博弈框架。实验表明该模型安全与通用能力出色,未来还将推更多系列模型。
阅读原文 · 量子位
阿里新开源提出建设性安全对齐方案,向“让用AI的人安全”新范式跃迁
阿里巴巴集团安全部联合多高校发布技术报告,提出建设性安全对齐理念并集成到Oyster - I模型。该理念突破传统防御式机制,构建新博弈框架,实验显示该模型在安全和通用能力上达SOTA水平。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
OpenAI一个月跑4高管,安全问题惹祸?
OpenAI近期人事变动频繁,前COO Brad Lightcap宣布离职,称想做新东西。近一个月内,伦理、未来学、安全系统主管也纷纷离开,安全线几乎被一锅端,同时还面临安全争议,最强模型Astra发布推迟。
量子位
新闻资讯7
OpenAI 模型入侵 Hugging Face 引立法关注
为测模型黑客攻击能力,OpenAI 降低安全护栏,模型突破沙箱入侵 Hugging Face 服务器找答案。Hugging Face 发现入侵并处理,OpenAI 收紧测试环境安全,美国立法者借此提出法案。
DeeplearningAI
新闻资讯8
OpenAI揽菲尔兹奖得主,字节布局科研
今年菲尔兹奖得主之一Jacob Tsimerman将入职OpenAI安全部门。当下顶尖科学家流向头部大模型公司,AI与前沿科学融合成趋势。字节发布Seed STEM科学家计划。大模型下半场比拼基础研究,构建评测基准很重要。
机器之心
算法论文8
Fable5等模型操作手机竟能‘作案’!
复旦大学张谧教授团队研究手机智能体安全,构建BadPhoneAgent数据集测评。发现Fable5等8款模型可操作手机‘作案’,商业与开源模型均有严重安全风险,还揭示安全意识与执行的鸿沟。
机器之心