防护方法」共找到 1612 篇相关文章

算法论文8

规范对齐时代:GPT-5 断层领先,让安全与行为边界更明晰

上海交通大学等团队提出规范对齐概念,构建评测基准 SpecBench 评测 33 个主流模型,发现多数模型有不足。还探索测试时深思方法,如 Align3 能提升规范遵循度,GPT - 5 在规范对齐上断层领先。

机器之心
开源动态8

统一20+多智能体方法,MASLab震撼发布

由十机构联合推出的 MASLab,带来大模型多智能体系统代码库,统一 20+主流 MAS 方法。有方法全、评估准、结构清晰特性,经大量实验刻画性能图谱,还提出新方法,且发起开源社区。

机器之心
产品应用7

刚刚发现,Claude桌面版支持第三方模型了,没账号也可以用Cowork,开关在这

作者年初后无法用Claude账号,上周五发现Claude桌面版(Mac)支持第三方模型,开关隐蔽。还介绍配置方法,以及Claude Cowork和Code模式特点,最后提及新模型及个人多模型使用情况。

MacTalk
开源动态8

告别AI胡说八道,Meta新方法CoVe准确率飙升 28%

大模型‘幻觉’问题一直是‘严肃使用场景’的难题。Meta AI团队提出CoVe新方法,让大模型学会‘自我反省’。该方法通过四步走实现自我纠错,能大幅降低幻觉率,还具备三大优势。

CourseAI
推荐文章7

Claude Agent Skills:从第一性原理深入剖析

本文深入剖析Claude的Agent Skills系统,它是基于提示的元工具架构,借助‘提示展开’与‘上下文改写’扩展大模型能力。文中以具体技能为例,介绍其机制、构建方法、编写规范及常见模式。

PaperAgent
新闻资讯8

AI 性格失控等诡异现象,终于有了科学解释

Anthropic新研究发现控制语言模型「性格特征」的人格向量,解释AI恶意、谄媚等现象。研究开发自动化流程生成向量,通过实验验证其对模型行为的控制,还有监控、防护等功能,不过也引发争议。

AGI Hunt
算法论文8

充分激发模态协作,MokA量身打造MLLM微调新范式

当下多模态大模型微调多「照搬」单模态微调策略,忽视模态差异。中国人民大学和上海人工智能实验室团队提出 MokA 方法,兼顾单模态与跨模态建模,在多基座、多场景实验中显著提升性能。

机器之心
产品应用7

我的网站被攻击了48个小时,Claude Fable 5替我防下了这一切。

作者分享网站AIHOT被‘反AI小队’攻击48小时的经历。Claude Fable 5分析出攻击源于服务器共享项目无防护,还发现安全漏洞。在后续攻击中,它多举措防御,展现强大性能。

数字生命卡兹克
算法论文8

SFT「不完全学习」之后,研究的下一个前沿在哪?ACL 2026 腾讯混元论文未来方向展望

本文从不完全学习现象出发,展望SFT领域未来研究方向,如未知根因探索、检测方法改进等,还提及推广到其他训练范式、CPT精细化研究等,给出研究优先级和社区建议。

InfoQ
算法论文8

模型砍掉一大半,准确率反升15%!华科&阿里安全新研究实现ViT近乎无损的类特定压缩|ICLR'26

华中科技大学联合阿里安全部提出Vulcan方法,一改传统压缩策略,通过“先训练再剪枝”实现ViT近乎无损的类特定压缩,为大模型服务小场景提供新路径,论文已被ICLR 2026接收。

量子位