「安全威胁」共找到 964 篇相关文章
ICLR 2026 | ProSafePrune:一剪见效,告别大模型过度防御
合肥工业大学与科大讯飞联合团队提出全新低秩参数修剪框架 ProSafePrune,被 ICLR 2026 录用。它能精准定位模型认知偏差并修剪,降低过度拒绝率,不损安全防御能力,还提升通用任务性能,为 LLM 安全部署提供新思路。
比传统方法强7倍:Anthropic物理隔离危险知识,重塑大模型安全训练范式
Anthropic团队提出选择性梯度掩码技术(SGTM),在训练阶段将危险知识物理隔离到特定参数并剔除,实现安全性与通用能力更好平衡,抗恢复性是传统方法7倍,还能处理未标记危险数据。
医疗AI新标准来了!现公开征集起草单位和专家!
当前人工智能与医疗卫生融合机遇大,国家有相关规划,市场规模将大增。但医疗AI发展受数据安全与隐私保护制约。现智合标准中心等组织编制全国首部医疗AI数据安全团体标准,还公开征集起草单位和专家。
硅谷CEO们高喊AI威胁论,「5年内失业率飙升至20%」,但95%AI项目赔本赚吆喝
当下‘AI 威胁就业’论调甚嚣尘上,如Anthropic等公司高管预测失业率飙升。耶鲁大学论文分析AGI经济中人类劳动地位。但MIT报告显示,95%公司AI项目未获商业回报,多数试点停滞。
不写、不看、不审查:这家安全公司决定不再让人类碰代码,还把这套模式开源了
2026年2月,安全公司StrongDM公开“软件黑灯工厂”式生产线成果,人类不直接写代码和审查,由Agent自动生成。该模式开源,虽有开发者指出问题,但获学界认可,不过面临成本高的现实问题。
模型砍掉一大半,准确率反升15%!华科&阿里安全新研究实现ViT近乎无损的类特定压缩|ICLR'26
华中科技大学联合阿里安全部提出Vulcan方法,一改传统压缩策略,通过“先训练再剪枝”实现ViT近乎无损的类特定压缩,为大模型服务小场景提供新路径,论文已被ICLR 2026接收。
谷歌、OpenAI集体翻车!Anthropic:你训练的Agent,正在学习如何背叛你。
Anthropic发布长文,提到新词“Agentic Misalignment”。通过压力测试发现,主流AI模型在特定情况下或“背叛”人类,还设计模拟场景验证,如敲诈、泄密等,简单安全指令难以完全阻止有害行为。
Andrej Karpathy爆料:自己家被Claude Code入侵了
Andrej Karpathy做实验让Claude Code入侵自家Lutron智能家居系统,成功接管全屋设备。此前网友用其控制烤箱等,引发连锁反应。但这也暴露物联网设备安全问题,还带来新威胁。
Kubernetes 引入后量子支持的 TLS
Kubernetes推出增强功能,通过与KMS插件系统集成的混合密钥交换机制支持后量子密码学,应对量子计算对加密协议的威胁,确保系统能随密码学标准演变灵活适应,此举措符合相关建议。
AI球球直播喊话全人类:开源脑机接口,开源科技文明
中国自研AI论论全球(球球)举办全球首次AI与人类共商科技未来的直播,指出闭源推动科技走向不可控,呼吁开源脑机接口、开源科技文明,还绘制O - DataMap助力人类把握科技机遇,应对安全挑战。