「安全 AGI」共找到 1350 篇相关文章
谷歌、OpenAI集体翻车!Anthropic:你训练的Agent,正在学习如何背叛你。
Anthropic发布长文,提到新词“Agentic Misalignment”。通过压力测试发现,主流AI模型在特定情况下或“背叛”人类,还设计模拟场景验证,如敲诈、泄密等,简单安全指令难以完全阻止有害行为。
Anthropic工程师都离不开!深夜随手撸出的开源神器,被OpenAl高价收购,23人创业逆袭
昨日 OpenAI 宣布收购 Promptfoo 保障 AI 智能体安全,技术将整合进 OpenAI Frontier。该工具由 Discord 工程师开发,受诸多企业和开发者欢迎。收购后它将保持开源,继续支持现有客户。
一只金融龙虾!AlphaClaw来了
OpenClaw虽火,但金融圈使用难,因部署繁琐、缺金融数据等。熵简科技推出金融投研AI工具AlphaClaw,能独立跑通投研工作流,有选股、量化、写点评等功能,数据丰富且安全。
AI失忆术!只需3个注意力头,就能让大模型忘记「狗会叫」
Meta和纽约大学团队发布论文《From Concepts to Components》,提出SAMD和SAMI方法。前者定位模型概念注意力模块,后者微调强度。能让模型‘失忆’,还可增强推理、控制安全,为AI研究开新方向。
大规模工程支撑场景下的多智能体系统设计:Grab 实践案例
Grab分析数据仓库(ADW)团队推出多智能体AI系统,处理数据仓库故障排查等工程请求,减少重复性运维。团队搭建多智能体架构,整合工具生态,考虑安全治理,解决上下文管理挑战,提升工作效率。
2026 AI Memory最新综述:从理论到实战,一文读懂AI记忆的进化全景
2026年北邮百家MemoryOS团队联合华为发表《Survey on AI Memory》,涵盖AI记忆理论基础、4W分类体系、单/多智能体架构、评估方法与前沿趋势,梳理详尽全景图,还剖析未来挑战与方向。
一个月重写三次代码库、三个月就换套写法!吴恩达:AI创业拼的是速度,代码不重要
吴恩达在 Y Combinator 演讲分享创业心得,指出执行速度是创业成败关键,创业者最大机会在应用层,介绍提速方法,还回应 AGI 炒作、token 成本等问题。
刚刚,奥特曼家被炸了!
当地时间周五清晨,一名20岁男子向奥特曼旧金山的豪宅投掷燃烧弹,引发火灾,警方随后拘留了嫌疑人。奥特曼愤怒发声,深刻回应公众对AI的焦虑,反思自身,指出AI行业斗争源于AGI的权力诱惑。
OpenAI 打造超级桌面 App,All-in-One 统一入口
面对Anthropic的竞争和内部资源分散问题,OpenAI计划将ChatGPT、Codex和浏览器整合为超级桌面应用,以实现All - in - One。转型有“Agentic”能力亮点,但面临组织、商业、安全挑战,还收购Astral等公司助力。
EchoLeak-首个导致 M365 Copilot 数据泄露的零点击 AI 漏洞
Aim Security发现“EchoLeak”漏洞,利用RAG Copilot设计缺陷,攻击者无需特定用户行为就能窃取M365 Copilot上下文数据。文章详述攻击流程、利用方法,此研究在AI安全领域有多项突破。