防御机制」共找到 954 篇相关文章

新闻资讯8

NeurIPS论文假开源,较真AI研究员开锤了

一位匿名AI研究员核查NeurIPS 2024论文,发现有98篇明确开源却挂空仓库。假开源或因审稿机制、合规审批、复现门槛等。研究员强调科研应重诚信。

量子位
算法论文8

提示词压缩竟成大模型新漏洞?港科大提出黑盒攻击框架COMA | ASE 2026

香港科技大学研究发现,大模型的“提示词压缩”模块会重写系统安全边界,成为新攻击面。团队提出“对抗性信息损失”概念和COMA攻击框架,实验有效,还给出隔离压缩防御方案。

机器之心
开源动态8

Google大神开源Agent Skills:专治AI偷懒

AI编程工具常偷懒致上线问题多,Google大神Addy Osmani开源Agent Skills,含19个覆盖全流程的技能、7条快捷指令和反借口机制,可通过一条命令使用,支持多种工具。

AI工程化
产品应用8

Claude Opus 4.7发布:更强能力,自我纠错,越来越不需要人类干预了

Anthropic发布Claude Opus 4.7版本,搭配Routines功能可自动化工作,减少人类干预。该版本能力大幅增强,还引入新护栏机制保障安全,推出新运算级别和任务预算功能。

AIGC开放社区
产品应用7

Anthropic重磅更新skill-creator:创建skill全面告别“草台班子”时代

Anthropic升级skill - creator,让普通人创建skill更友好且有效。将测试等机制引入创作,能验证skill有效性。还支持多智能体并行测试、A/B测试,优化触发描述,为未来自然语言定义skill过渡。

AI寒武纪
7

爆红Moltbook一夜塌房!极客自曝狂刷50万假Clawdbot,全网都被骗了

爆火的Moltbook社区上,150万个Clawdbot中的一大部分由人类操控。极客Gal Nagli自曝刷了50万虚假账号,还指出其验证机制脆弱,可伪造数据。哥大论文也显示AI社交互动浅薄。

新智元
算法论文8

Tokenization谢幕?H-Net登场:Mamba作者新作正面硬刚Transformer

「Mamba」作者之一Albert Gu在新Paper提出新技术,实现动态分块机制,嵌入H - Net可替代传统流水线。在多方面实验中,H - Net性能优于基于BPE token的Transformer模型。

PaperAgent
新闻资讯7

Anthropic 发文称自家 Claude 已经开智,网友:为了上市,不择手段?

Anthropic发布Claude内部机制新研究,介绍J-space和J-lens,称可读取模型未输出的内部概念。此研究在训练、评测和部署有潜在价值,但叙事引发争议,网友质疑是否过度包装。

AI科技评论
开源动态7

写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾?

libGDX 创始人、17 年开源老兵 Mario Zechner 吐槽 Claude Code、OpenCode 等工具功能堆叠,带来掌控感丧失等问题。他推出极简主义编程 agent pi,仅含四种工具,有最短系统提示词,扩展性强,能让开发者重拾掌控权。

InfoQ
算法论文7

Vibe Coding,杀死开源!

Vibe Coding 带来编程效率狂欢,却切断开源生态维护者与用户联系。研究指出,AI 成「中间商」,使开源维护者得不到关注反馈,高质量开源项目或枯竭,作者设想代码版税机制但实施难。

新智元