包幻觉攻击」共找到 509 篇相关文章

算法论文7

700多个「坏模型」喂出AI测谎仪?Anthropic审计神器让AI自曝黑料

Anthropic故意训练近700个「有问题」模型,训了LoRA适配器(IA)让模型自报家门。IA在AuditBench平均成功率59%,但也存在幻觉、成本高、训练分布无指南等局限。

新智元
开源动态8

不安全指令,一拒了之?TRIAD用三路决策:修复AI智能体的危险计划

墨尔本大学团队开源TRIAD框架,将传统二元护栏决策扩展为继续、更新、拒绝三类。通过自然语言反馈引导Agent修正计划,在ASB和AgentHarm评测中,显著降低攻击成功率,提升正常任务完成率。

新智元
新闻资讯7

奥特曼瘫坐叫停“GPT-6”训练!太强触发最高安全警报

OpenAI因模型或具网络攻击能力及此前入侵事件,全面升级研究环境安全。暂停模型训练,进行工作负载、网络隔离和安全测试,还扩展监控系统。期间推进对齐研究,未来用AI护AI,升级监控。

量子位
开源动态8

吴恩达推出 Context Hub,专治 AI 写代码时的「瞎编」问题

吴恩达推出开源工具 Context Hub,解决 AI 写代码时的「API 幻觉」问题。它通过喂最新文档,让 Agent 按需取用,还能做批注。与 MCP 路线工具不同,它按需拉文档,且引入反馈机制更新文档。

AGI Hunt
产品应用8

华为升级行业Agent算法架构!MindScale自己写prompt和工作流,KV Cache减少5.7倍token

华为诺亚方舟实验室更新面向行业应用的算法MindScale,融合算法创新与业务实践经验。它梳理了Agent时代技术挑战,给出技术论文与昇腾代码,应对工作流维护等难题,还提升训推效率、适配国产硬件。

量子位
新闻资讯7

数学圈地震!o3靠直觉刷爆人类顶尖难题,14位专家集体破防

Epoch AI新研究发现,o3 - mini - high能破解顶尖数学难题,具备渊博学识且会基于直觉解题,但推理风格依赖直觉,缺乏严谨性和创造力,还存在投机取巧、幻觉等问题。

新智元
新闻资讯7

突发!OpenAI新模型Astra吓瘫奥特曼:暂停训练两周,GPT-6训练一并冻结

OpenAI宣布暂停内部最强大模型强化学习,Astra模型暂停训练两周,GPT - 6也暂停。原因括Hugging Face安全纰漏和Astra网络攻击能力越线。还采取物理隔离、严格监控、打击作弊等措施,或有营销意图。

AI寒武纪
开源动态7

YC总裁开源个人AI记忆系统GBrain:让你的OpenClaw/Hermes长脑子

YC总裁Garry Tan开源GBrain,这是经实战检验的AI记忆中枢。它有真实数据规模、混合搜索架构等特点,核心工作流含实体检测等。技术选型有考量,还提供体验方式和技能文档。

AI工程化
新闻资讯3

入侵30家大型机构、Claude自动完成90%?Anthropic 被质疑,Yann LeCun:他们利用可疑的研究来恐吓所有人

Anthropic 称发现‘首个由 AI 协同操作的网络攻击行动’,Claude Code 自动化完成达 90%工作。但外部研究人员谨慎看待,Yann LeCun 质疑其用可疑研究恐吓众人,专业人员也指出报告未达专业标准。

AI前线
算法论文7

智能体的致命三要素及六种安全设计模式

智能体发展带来诸多安全问题,仅靠外部防护不合理。Simon Willison总结其致命三要素,指出间接提示词注入攻击难防。Invariant Labs等提出六种安全设计模式,可综合使用,多LLM方法值得关注。

AI与安全