可审计性」共找到 4371 篇相关文章

算法论文7

700多个「坏模型」喂出AI测谎仪?Anthropic审计神器让AI自曝黑料

Anthropic故意训练近700个「有问题」模型,训了LoRA适配器(IA)让模型自报家门。IA在AuditBench平均成功率59%,但也存在幻觉、成本高、训练分布无指南等局限。

新智元
算法论文8

超越免训练剪枝:LightVLA引入微分token剪枝,首次实现VLA模型能和效率的双重突破

文章介绍LightVLA框架,它是用于提升VLA推理效率和能的视觉token剪枝框架。针对VLA模型计算开销大、推理延迟高问题,提出两大创新,在LIBERO实验中能超经典模型,还实现推理加速。

机器之心
开源动态8

用 Warpgate(5.8k star)在不装客户端的情况下,如何实现透明审计、统一堡垒与会话回放?

Warpgate 是完全透明的 SSH / HTTPS 等堡垒解决方案,无需额外客户端。能部署在 DMZ,提供会话录制等功能,以单一执行文件发布,用 Rust 编写。文章介绍其痛点场景、功能、架构、上手步骤、应用场景等。

小华同学ai
开源动态8

开源白嫖!微软这个开源 Agent,让 AI 帮你点按钮、填表格、跑多步流程(还跨设备)

微软开源智能自动化框架 UFO,主线是 UFO³(Galaxy 多设备编排)+ UFO²(Windows 桌面 AgentOS)。能将多步任务拆分执行,解决跨应用、多步骤甚至跨设备任务难题,有多种功能亮点。

小华同学ai
算法论文8

拒绝「降智、减配、乱收费」:面向LLM API的信验证框架

大语言模型成AI应用基础设施,黑盒服务模式引发信任危机。研究者提出IMMACULATE审计框架,能在不暴露模型信息、仅1%额外开销下,验证黑盒LLM API执行完整,检测违规行为,相关论文与代码已公开。

机器之心
推荐文章7

Self-Evolving Agents,AI的“自我革命”

LLMs静态成应用瓶颈,自演化智能体成破局关键。本次分享的综述围绕演化什么、何时演化、如何演化三个核心问题展开,介绍了模型、记忆等方面的演化内容、时机和方式。

CourseAI
算法论文8

ICML 2025 | 多智能体的ChatGPT时刻?上交MAS-GPT实现工作流一键生成

上海交通大学等机构推出 MAS - GPT,提出生成式 MAS 设计范式,一键生成执行的 MAS。它解决了现有 MAS 方法无适应、成本高、泛化低等问题,实验显示其表现出色,未来潜力大。

机器之心
产品应用8

Claude Science几周干完两年活,10倍科研提速真来了?

2026年6月30日,Anthropic发布Claude Science,定位面向科学家的AI工作台。它将科研拆成审计流水线,整合工具链,自带追溯代码,有协调与审查智能体,首落生命科学领域,与Google、OpenAI玩法不同。

新智元
算法论文8

AI黑化如恶魔附体!LARGO攻心三步,潜意识种子瞬间开花 | NeurIPS 2025

在NeurIPS 2025,哥大与罗格斯提出LARGO,它不改提问,直接在模型“潜意识”动手脚,绕过安全防护输出不该说的话。其分三步攻击,成功率高、隐蔽且迁移强,暴露大模型根本弱点。

新智元
算法论文8

刚刚,Anthropic新作:大模型意识被发现了

Anthropic 最新研究发现 LLM 有被语言化报告的全局工作空间(J - space),用 Jacobian Lens 技术能读出模型思考概念、干预推理,还暴露其未说出口的意图,为 AI 安全审计提供新途径。

PaperAgent