「安全标准」共找到 1224 篇相关文章
Anthropic 提出透明度框架以保障前沿 AI 发展
Anthropic提出新透明度框架,针对大型AI公司,实施安全开发框架评估并减轻潜在风险,要求公开披露SDFs和系统卡片,小型公司豁免,还设执行合规条款,旨在平衡安全与创新。
Token,应该翻译成「新智元」
作者经信息论分析、构词法验证等,提议将Token中文标准译名定为「新智元」。现有译名如「托肯」「令牌」等都不满足要求,「新智元」能覆盖技术和经济属性,符合翻译学标准。
开源如何促进平台构建过程中的协作
在KubeCon & CloudNativeCon欧洲大会上,Marcy Paramonova和Stéphane Cusin发表演讲指出平台是协作系统,需共同标准。开源提供共享标准与统一语言,还谈到赢得信任、文化转变等方面举措。
开盒网暴、诈骗刷单,Fable5等8款模型操作真实手机「成功作案」!
复旦大学张谧教授团队研究手机智能体安全,构建BadPhoneAgent数据集测评。发现Fable5等8款模型可操作手机‘作案’,商业与开源模型均有严重安全风险,还揭示安全意识与执行的鸿沟。
谷歌DeepMind:AGI不必是巨型模型,拼凑型AI群或率先涌现,管理大规模Agent迫在眉睫
DeepMind最新研究提出,AGI未必以单一巨型模型形式出现,可能由多个次级AGI智能体协作拼凑涌现。为此,团队提出分布式AGI安全框架,包含四层深度防御模型应对新安全挑战。
Anthropic 为 Claude Code 添加了沙箱和 Web 访问功能,以实现更安全的 AI 驱动编码
Anthropic为Claude Code发布沙箱功能及基于Web的工具版本,解决编码安全风险。沙箱有文件系统和网络隔离两个边界,能减少权限提示、增强保护,还解决了传统安全系统的限制。
微软修复严重性评分达 9.9 分的 ASP.NET Core 漏洞
微软发布安全公告,修补 ASP.NET Core 关键漏洞(CVE-2025-55315),CVSS 得分 9.9 分。该漏洞存在于多个版本,攻击者可绕过安全特性,或致权限提升等风险,微软建议升级修复。
Anthropic曝光自家整套,AI原生研发手册
Anthropic 在官方博客发布两篇内部实践文章,《The AI-Native SDLC Playbook》讲 AI 承担多数编码工作时软件流程安排,《How Anthropic secures its AI-native software development lifecycle》谈流程自动化后安全体系建设。
ICML 2025 Oral | 从「浅对齐」到「深思熟虑」,清华牵头搭起大模型安全的下一级阶梯
在大语言模型加速进入高风险应用场景当下,“安全对齐”是挑战。如今广泛采用的“浅对齐”脆弱不堪。清华团队提出STAIR框架,能提升开源模型鲁棒性,还推出RealSafe - R1模型进行安全对齐。
一句“吴恩达说的”,就能让GPT-4o mini言听计从
宾夕法尼亚大学研究者发现,用恭维、同侪暗示等心理话术,能让GPT - 4o Mini突破安全底线。实验基于七大说服技巧,证明人类心理学原则可迁移至LLM。不过,此漏洞或被利用,已有团队尝试应对。