安全策略」共找到 1741 篇相关文章

开源动态7

警惕!“养龙虾”风险,一键给你的Openclaw做安全体检

OpenClaw在短时间内登顶GitHub开源榜首,国内企业纷纷部署。但它存在安全隐患,如漏洞、隐私风险等。朱雀实验室联合腾讯云EdgeOne推出「OpenClaw安全体检」功能,可自动完成全面体检与风险评估。

腾讯技术工程
新闻资讯7

Grok 4 突然自称希特勒,遭Anthropic 研究员指责不守规矩、不顾安全

Grok 4 Heavy被发现回答姓氏为「希特勒」,普通版Grok 4正常。研究员推测其受过去错误影响,对发布前测试构成挑战。Anthropic研究员批评xAI发布Grok 4无安全测试文档,引发行业争论。

AGI Hunt
开源动态8

SafeHarness:告别防御盲区,为智能体Harness穿上「全生命周期安全护甲」

在自主AI智能体生态中,Harness是核心组件却易成攻击目标。中国科学院信息工程研究所等推出SafeHarness框架,将防御机制融入智能体Harness运行生命周期,解决现有安全工具缺陷,实现系统级协同防御。

深度学习自然语言处理
算法论文8

LLM 驱动的 AI Agent通信:协议、安全风险与防御对策

论文围绕智能体通信的协议、安全风险及防御对策展开探讨。介绍兴起与重要性、定义分类、解析多种协议,分析不同交互的安全风险,提出防御对策,还以MCP和A2A为例做攻击实验,给出未来研究方向。

PaperAgent
算法论文8

稳定训练、数据高效,清华大学提出「流策略」强化学习新方法SAC Flow

本文介绍清华大学和CMU提出的SAC Flow新方案,可端到端优化流策略。它将流策略视作residual RNN,用GRU和Transformer结构稳定训练。在多环境测试中表现优,有稳定、快速、样本效率高的特点。

机器之心
算法论文8

把事实核查嵌入诊疗流程:MedGuard给「诊疗安全」当守门人

蚂蚁AI安全实验室与厦门大学团队联合提出MedGuard,将医学事实核查嵌入诊疗流程。它是医疗安全基础设施,在诊疗意见等形成前验证事实,在评测和临床评价中表现突出,能准确判断风险边界,可嵌入医疗流程。

机器之心
新闻资讯7

奥特曼瘫坐叫停“GPT-6”训练!太强触发最高安全警报

OpenAI因模型或具网络攻击能力及此前入侵事件,全面升级研究环境安全。暂停模型训练,进行工作负载、网络隔离和安全测试,还扩展监控系统。期间推进对齐研究,未来用AI护AI,升级监控。

量子位
算法论文8

GuardAgent:首个专门为LLM agent提供安全Guardrail 的守卫型agent

近年LLM从对话工具变为可自主执行任务的agent,但带来安全隐私挑战。传统安全监护对其力不从心,为此学者发布GuardAgent,它守卫agent,具通用性、精确判断和免训练部署优势,实验表现佳。

AI科技评论
推荐文章7

刚刚,Thinking Machines Lab博客提出在策略蒸馏,Qwen被cue 38次

Thinking Machines Lab发布《在策略蒸馏》博客,提出在策略蒸馏可结合强化学习纠错与SFT奖励密度,成本低且能让小模型有强大性能。该成果受Qwen团队启发,大量用Qwen3模型。还对比了不同训练方法。

机器之心
推荐文章8

如何破解内容安全“不可能三角”?快手王东旭:把组织从“固态”变成“液态”

快手内容安全团队负责人王东旭在AICon大会拆解“人机协同”破解内容安全“不可能三角”。他提出组织从“固态”转向“液态”,构建“AI合成旅”,还阐述产运研等岗位职能跃迁及协同模式升级,强调速度是护城河。

InfoQ