最坏风险控制」共找到 931 篇相关文章

算法论文7

一段 signature,不仅撬开了 Opus 的隐藏推理,还让 Kimi、GLM 露出了"熟悉感"

研究者发现,将 Opus 等强模型返回的加密推理块交给同家族弱模型,弱模型可能转写出隐藏内容。如用 Haiku 读取 Opus 的加密信息。此外,公开的 Agent 轨迹存在隐私泄露风险,部分开源模型易受 Opus 风格影响。

深度学习自然语言处理
新闻资讯7

突发:Claude引入强实名制验证!必须真人手持证件自拍,否则直接封号!

Anthropic宣布在Claude平台推出身份验证功能,部分用户访问特定功能或触发风控时需强制验证,要手持证件自拍。这一举措让中国用户账号风险大增,还可能冲击相关生态链,用户或转向ChatGPT。

新智元
算法论文7

首篇具身智能机器人「安全」综述:LLM如何跨越物理鸿沟?

最新综述首次系统探讨LLM控制机器人的安全威胁、防御机制与未来挑战,指出LLM的具身鸿沟导致其在物理空间可能执行危险动作,而现有防御体系存在逻辑与物理脱节等问题。

新智元
算法论文8

微软 Agentic 组织:下一代 AI 系统

微软研究院提出全新推理范式AsyncThink,让LLM从单打独斗进化成带团队的项目经理。它把并发控制转为纯文本协议,经两阶段训练,实验中全方位碾压传统方法,还具跨领域泛化能力。

PaperAgent
开源动态8

手机上也能写代码?Happy Coder 最佳实践完整指南

Happy Coder可让手机控制电脑上的Claude Code会话,实时双向同步。它由CLI、手机App和中继服务器组成,安装简单,有多种最佳实践和工作流模式,还具端对端加密的安全性。

AI Reading Hub
开源动态7

上门安装OpenClaw年入百万,但装完才是噩梦!

硅谷小伙Michael上门安装开源软件OpenClaw年入百万,国内也有不少人靠此赚钱。但OpenClaw不包含语言模型,运行需接入外部模型付费,还有心跳机制烧钱,且存在隐私安全风险

探索AGI
新闻资讯7

The Batch: 878 | Meta 与 OpenAI 加强防护措施

随着未成年人使用聊天机器人的不良互动受关注,Meta 和 OpenAI 承诺加强管控。Meta 将更新聊天机器人,避免不当对话;OpenAI 要推家长控制功能。此前两家公司均因相关问题遭批评。

DeeplearningAI
7

刚刚,Anthropic推出Claude Chrome插件,仅限1000人

Anthropic发布Claude for Chrome扩展,让Claude能在浏览器操作,仅向1000名Max计划用户开放预览。虽功能强大,但面临提示注入攻击风险。不过Anthropic有多层防护,降低了攻击成功率,并给出用户安全建议。

AGI Hunt
新闻资讯8

ChatGPT智能体正式发布,多个创业赛道昨夜无眠

OpenAI正式发布ChatGPT Agent,将思考与执行能力统一,可接管电脑,能处理工作和生活多种事务。它优化后能力达SOTA,但也有风险。这或重塑互联网,让Agent创业者重新审视竞争力。

量子位
算法论文8

谢赛宁与Jaakkola团队重磅研究:无数据Flow Map蒸馏

麻省理工学院Tommi Jaakkola和纽约大学谢赛宁团队联合研究,提出无需数据、仅从先验分布采样实现flow map蒸馏的新方法。该方法可规避“教师 - 数据不匹配”风险,在ImageNet实验中表现出色。

机器之心