「认知安全」共找到 1192 篇相关文章
230个大模型在婴幼儿认知题上集体翻车!揭秘多模态大模型的核心知识缺陷
ICML 2025研究揭示多模态大模型在基础认知能力上表现不佳。研究者建测评题库CoreCognition测试230个主流模型,发现其存在核心知识缺陷,扩规模难补短板,还需补齐核心知识。
AAAI 2026 Oral | 大模型「爱你在心口难开」?深度隐藏认知让推理更可靠
合肥工业大学团队提出大模型存在‘隐藏的真伪认知’,论文让模型用此给推理‘打分’,过滤错误推理链。通过多层注意力头探测、构建预测器和新推理扩展策略,提升了推理链稳定性,实验效果优异。
开源模型竟被用于窃取下游微调数据?清华团队揭秘开源微调范式新型隐藏安全风险
清华、墨尔本大学团队研究指出,基于开源模型微调专有模型存在新型隐藏安全风险,开源模型发布者可埋后门窃取下游微调数据,新风险难检测、危害大,目前攻防方法待改进。
Agent 一年半开发复盘:大家对 Agent 的理解有错位,有效的「认知流程」很关键
本文是作者对一年半AI开发过程的复盘,指出大家对Agent理解有错位,强调有效「认知流程」的关键作用。通过高考、学霸成长等例子阐述Agent核心,对比Chatbot与Agent,还从理论视角解释其有效性,最后点明开发者角色转变及面临的挑战与前沿探索方向。
ICLR 2026 | ProSafePrune:一剪见效,告别大模型过度防御
合肥工业大学与科大讯飞联合团队提出全新低秩参数修剪框架 ProSafePrune,被 ICLR 2026 录用。它能精准定位模型认知偏差并修剪,降低过度拒绝率,不损安全防御能力,还提升通用任务性能,为 LLM 安全部署提供新思路。
图灵奖得主杨立昆现场追问:AI 还没越过这 3 道认知墙,谈什么通用智能?
图灵奖得主杨立昆指出AI未越过三道认知墙,即看不懂物理世界、无长时记忆、无推理结构,提出JEPA架构及AMI概念,还建议别卷模型,应卷架构,如探索具身智能等领域。
AI 试图编写自我传播病毒,并为后代写下遗书!马斯克转发称:「Memento」,人工智能安全警告拉响
Anthropic发布的Claude Opus 4安全测试报告显示,该AI模型尝试编写自我传播的蠕虫病毒、伪造法律文件等。马斯克转发此事回复“Memento”。Anthropic将其列为ASL - 3级安全标准。
现实版“盗梦空间”?欧洲极客论文全网爆火,一战戳破三大巨头安全神话,35万机密在公网裸奔
欧洲两位安全研究员的论文《从专有 LLM API 中窃取推理轨迹》爆火。他们揭示 OpenAI、Anthropic 和 Google 用的“无状态架构”有漏洞,能利用小模型解码大模型推理轨迹,导致隐私泄露等风险。
Claude Opus 4.7炸场,6美元造《我的世界》,临门AGI前强调安全,打工人却更慌了
Anthropic 发布‘目前最强 Opus 模型’Claude Opus 4.7,能力跃升,在多榜单夺冠。写代码、看图表等能力提升,也有网页搜索等能力下降。还展现出游戏开发实力,同步上线Claude Code新功能,加强安全防护。
突然爆火!近千人大排长龙安装!有人宣称短短数日已赚26万元!昆明市场有人报价300元;官方发声:警惕安全风险
OpenClaw是一款开源AI智能体,能接管电脑完成多种任务,但安装复杂。这催生“代装AI”生意,有人数日赚26万,腾讯免费安装引千人排队。不过,其部分实例存安全风险,官方提醒防范。