「安全推理」共找到 2868 篇相关文章
AI安全得查祖宗三代?Anthropic登Nature揭秘大模型潜意识传染
Anthropic论文登上Nature,揭示AI模型仅通过纯数字序列就能继承另一模型的危险偏好。研究表明,即使删掉敏感词,隐性信号仍能传递,且代码和推理链也是传染通道,这对AI安全评估提出新挑战。
ICML 2026前瞻:投稿翻倍背后,机器学习正在换挡
第43届国际机器学习大会(ICML 2026)7月6 - 11日将在韩国首尔举行,主题为‘Machine Learning for the Real World’。今年投稿量翻倍,接收率26.6%,还做了两项制度调整。论文反映出LLM推理、AI安全、模型压缩等趋势,中国研究者表现亮眼。
无需标注和奖励模型!仅靠自信度RL,16个样本训练20步,效果飙升21%!
论文提出RLSC,让大语言模型用自身答案置信度作奖励信号,摆脱人类标注依赖。它以模型自信度内部信号替代多数投票外部信号,小成本提升模型数学能力,还让模型学会快推理,不过也存在安全隐忧。
突发!Fable 5.1遭黑客破解,27万字提示词泄露
Fable 5.1和Mythos 5.1发布,Fable 5.1推理成本低32%。但发布几小时后被破解,27万字提示词泄露,曝光了其安全限制、隐私保护等秘密。它工具增加,还破解密码、能完成多种任务,不过也有用户抱怨耗token等问题。
模型训练最重要的依然是 Scaling —— 对话阿里通义千问 Qwen 多语言负责人杨宝嵩 | Open AGI Forum
本文是对阿里通义千问Qwen多语言负责人杨宝嵩的专访。他透露Qwen一开始就将国际化视作核心战略,团队建立文化标注体系确保内容安全合规。还谈到多语言推理难题及应对策略,认为扩大模型规模和数据量仍重要,合成数据是延续Scaling Law的关键。
1.2K Star!终于有工具开始认真解决 AI Agent 安全问题了!
作者深度使用AI Agent时担忧其安全性,GitHub上斗象科技开源的ClawVault项目,上线不久获1.2K Star。它为AI Agent提供多场景安全隔离方案,有分格管理、可视化监控等实用设计,适配Python3.10+环境,安装方便。
公开模型一切,优于DeepSeek-R1,英伟达开源Llama-Nemotron家族
英伟达推出面向高效推理的 Llama-Nemotron 系列模型,包括 Nano、Super、Ultra 等规模,具备卓越推理能力与效率,采用开放许可。模型支持动态推理切换,训练结合多方法,性能优于 DeepSeek-R1 等。
哈佛发现基础模型比你想象中更强大:纯采样方法可超越RL
论文提出基础模型本身已具备强大推理能力,通过“幂采样”纯采样算法,在多推理任务上媲美或超越RL后训练,挑战“RL才能提升推理”观念,为理解基础模型潜力开新视角。
AAAI 2026 Oral | 拒绝「一刀切」!AdaMCoT:让大模型学会「看题下菜碟」,动态选择最佳思考语言
多语言大模型面临语言选择难题,现有跨语言推理方法存在缺陷。新加坡研究团队推出AdaMCoT框架,通过自适应路由机制动态选语言推理,提升跨语言事实推理准确性与一致性,效果超越传统方法。
开源AI黑客Agent,自动检查代码漏洞并修复,离AI编程的全流程自动化不远了。
开源的AI Agent能自动查代码漏洞并修复,是集自动化渗透等功能于一体的安全测试平台。Strix作为开源AI安全测试工具,无需手动渗透测试,支持多类型安全评估,功能强大。