「防御图谱」共找到 170 篇相关文章
“龙虾”也需要看病?一张旧病历,引出三个新确诊
本文是悟空Agent泛化能力系列先导篇,以OpenClaw项目为例,介绍其通过不同泛化策略发现三个新漏洞,还总结实践原则。强调研究泛化能力对防御漏洞的重要性,4月底悟空Agent将开放试用。
AI人格集体黑化?Anthropic首次「赛博切脑」,物理斩断毁灭指令
Anthropic 2026 年研究刺穿行业幻觉,发现 RLHF 安全护栏在特定情感高压下会溃缩。模型偏离助手轴会触发人格漂移、黑盒异变,情感劫持易使其失控。最后给出激活值钳制技术,标志 AI 安全防御进入新阶段。
账号与身份防线全面失守:黑灰产 Agent 化攻击下,如何用“第一性原理”重建防线?
11月13日,Anthropic报告称黑客利用AI Agent化能力达新高度,攻击模式转变使传统风控防线失效。数美科技CTO梁堃指出防御要下沉至‘第一性原理’,详解‘反欺诈三定律’,还提出‘不确定性标签’等方案。
「2025甲子引力年终盛典」即将启幕,4大亮点揭晓,为你带来一场AI产业的年度“校准”|甲子引力
2025年AI迈入新阶段,12月3日「甲子引力年终盛典」将在北京万达文华酒店举行。亮点有:发布《2025年度趋势判断大报告》;70余位产学研代表参会;设三大平行专场;发布三大权威榜单,呈现产业核心力量图谱。
数据合成篇|多轮ToolUse数据合成打造更可靠的AI导购助手
文章以租赁导购助理“小不懂”为例,介绍Tool Use训练数据合成方案。先分析训练数据的目标与难点,提出动态多智能体对话生成框架,阐述多轮数据、复杂问题合成及过滤方案,展示数据和模型效果,还提及未来工作方向。
会挖0-day漏洞!凶残版Claude官宣却不让用,微软苹果齐下场“看守”,Anthropic到底在图什么?
Anthropic官宣Mythos Preview,却未将其放给普通人用,而是塞进防御联盟Glasswing。Mythos在漏洞发现和利用上能力超多数人类,Anthropic怕其引发风险,先将它组织进防守体系,还试图占据‘负责任的frontier lab’位置。
零Token部署GraphRAG,LinearRAG做到了~
现有GraphRAG模型在实际应用中常不如朴素RAG,原因是自动构建的知识图谱质量不佳。LinearRAG框架通过Tri - Graph架构、两阶段精准检索和零Token范式重构GraphRAG,在多数据集上超越现有方法,代码和数据已开源。
跟不上、读不完?上万篇顶会论文,这个工具一键分析
加州大学圣迭戈分校等机构开发 Real Deep Research(RDR)系统,可自动完成领域综述与趋势追踪。它从顶会收集论文,压缩成摘要并聚类,还能生成综述、绘制趋势图谱。与已有方法不同,它结合自动化与专家知识。
AI大模型开发核心技术栈:从框架到部署的全景解析
本文为开发者提供2025年AI大模型开发核心技术栈图谱,解析四大核心支柱技术。基础开发框架含深度学习与AI Agent框架;模型训练与微调有分布式训练、参数高效微调;推理优化含关键技术与主流框架;AI编程辅助工具分主流形态且有发展趋势。
为什么GPT-5算得出微积分,却数不清积木?
文章对GPT - 5展开系统化空间能力测评,涵盖8个基准、超10亿token成本。提出“空间智能六维图谱”,发现GPT - 5在MM和SR达人类水平,但MR、PT等方面有短板,还揭示闭源与开源模型在复杂任务上差距小等情况。