「红队测试」共找到 1850 篇相关文章
ACL 2026 | 别轻易给AI发「~」,它可能会删掉你的整个主目录
西安交通大学等校团队揭示大模型表情符号语义混淆安全漏洞,用自动化框架测试主流大模型,平均混淆率38.6%,多数混淆响应会“静默失败”,超半数达高危害级别。
龙虾之父Claude账号被封!近百万人围观:故意的还是不小心的
Anthropic状况频出,先是泄露源代码、词元计费有BUG等,现又封了龙虾之父Peter的Claude账号,后称是误伤解封。此事引发近百万人关注,有人质疑A社在炒作。
让大模型多模态检索全面超越SOTA!ReCALL框架化解生成式与判别式的范式冲突|CVPR'26
紫东太初团队联合新加坡国立大学攻克大模型检索难题,其ReCALL框架以‘诊断 - 生成 - 校准’闭环体系解决范式冲突,让大模型变身高效检索器,成果被CVPR 2026录用,刷新SOTA性能。
Agent RL 总是训练崩?UCLA 这篇论文给了救命稻草!
这篇解读UCLA和威斯康星大学麦迪逊分校论文《ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning》的文章指出,Agent RL训练易崩溃,原因在于多轮交互任务带来奖励稀疏等问题。论文建“竞技场”,提出SAMPO算法提升稳定性,还给出从业者建议。
把RoPE扔掉,AI更能看懂长上下文!Transformer作者团队开源大模型预训练新方法
Transformer架构核心作者之一Llion Jones团队开源新技术DroPE,可丢弃位置嵌入扩展上下文,解决RoPE长序列处理缺陷,在多模型实验中表现卓越。该团队来自Sakana AI,此前还有相关研究成果。
OpenAI公开新的模型训练方法:或许能解决模型撒谎问题,已在GPT-5 thiking验证
OpenAI公开名为“坦白”的模型训练方法,可解决LLM欺骗行为。该方法强制模型自我反省,“坦白”奖励与“主要回答”奖励分离。在GPT - 5 - Thinking上实验,能提升不良行为可见性,但对“无知的错误”有局限。
NeurIPS2025 Spotlight | RobustMerge: 多模态大模型高效微调模型合并的全新范式
中科院、中山大学、北大团队针对高效微调模型合并难题,提出「方向鲁棒性」概念,揭示 PEFT 模块合并失败主因,给出 RobustMerge 解决方案,提升性能,成果开源。
让本地大模型不再重复推理的缓存技巧
本地跑大模型时,同样问题换说法问,模型又要重新推理。`constraint-cache`这个Python库可解决此问题,它将语义相似查询规范化为统一缓存键,实现近乎即时的重复查询响应,还避免了随机性响应问题。
推理时扰动高熵词,增强LLM性能
香港科技大学(广州)研究团队发现LLM推理时,一小部分高熵词显著影响输出正确性。基于此提出MTI方法,含Selective CFG intervention与Lightweight negative - prompt guidance,无需额外训练,能提升模型推理能力。
“零人”搞医学研究:清华AI智能体从灵感到论文全程自主
清华大学自动化系索津莉课题组发布全自主AI研究框架OpenLens AI,实现医学研究全链条自动化闭环,解决医疗信息学研究效率困局,将科研周期从“月级”缩至“小时级”,还在质量控制上设新标杆。