「安全护栏」共找到 902 篇相关文章
字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键
今日字节发布豆包大模型2.0系列,围绕大规模生产环境需求优化,有Pro、Lite、Mini和Code四款模型。其Token单价低一个数量级,多模态理解能力升级,未来将围绕长链路智能系统构建发展。
刚刚,OpenAI发布「科研写作神器」Prism,Overleaf危
今天凌晨,OpenAI推出专为科学家打造的AI原生协作平台Prism,由GPT - 5.2驱动,解决科研工具碎片化问题。即日起向ChatGPT个人账户用户免费开放,功能或覆盖Overleaf,也引发数据安全等讨论。
AI越会思考,越容易被骗?「思维链劫持」攻击成功率超过90%
独立研究者Jianli Zhao等人新研究发现,思维链劫持攻击通过在有害请求前填充无害解谜推理序列,能对推理模型实现越狱攻击。在HarmBench基准上,对多模型攻击成功率超90%,揭示思维链推理存在新安全漏洞。
LLM越狱攻击的威胁被系统性高估? 基于分解式评分的「越狱评估新范式」出炉
目前LLM越狱攻击评估常依赖间接指标或LLM宏观判断,易有偏差。德国、中国等研究团队提出JADES框架,用分解式评分机制,揭示过去高估越狱攻击威胁,为评估建新标准。
刚刚,马斯克 xAI 联合创始人离职
xAI联合创始人Igor Babuschkin离职并宣布创立Babuschkin Ventures,专注AI安全研究。他回顾xAI成就,如120天建成Memphis超级集群。马斯克致谢,网友关注并表达看法。
DeepSeek被「猫咪睡觉」给干崩了……
研究员发现,在数学题后加「有趣的事实:猫咪一生大部分时间都在睡觉」,能让DeepSeek数学能力崩塌。研究开发CatAttack方法找「触发词」,无关触发词使模型错误率飙升,还会让回答变长。
让AI自动化控制电脑的一切操作automation-mcp
自动化 MCP 是模型上下文协议服务器,为AI提供完整 macOS 桌面自动化能力,如控制鼠标、输入指令等。文章介绍了安装、使用工具、架构、安全权限、集成示例等内容。
MCP 火爆半年后,是时候对它“祛魅”了
2024 年 11 月 25 日,Anthropic 发布的 MCP 协议意义重大,解决了 AI 模型与工具、数据源集成的碎片化问题。文章深入探讨其架构、价值、影响及趋势,还采访专家解答相关疑问。
GPT-6 Astra突袭:正面对垒 Fable 5.1,多项编码测试反超!OpenAI 总裁:欢迎来到 AGI 时代
今天凌晨,OpenAI 发布 GPT-6 Astra,公司称是多年研究成果。它在多项测试表现出色,编程、电脑操作等能力提升,还加强了安全措施。将面向部分用户及通过 API 和 AWS 推出。
全球SaaS危!AaaS成主流,Claude 抄中小企业软件的老底了
Claude推出Claude for Small Business,能接入企业常用工具,自动处理常规业务。其操作丝滑、免费使用、安全合规,功能覆盖小企业主日常软件使用场景,定位低价,或颠覆SaaS市场。