「智能体安全」共找到 4146 篇相关文章
Anthropic曝光自家整套,AI原生研发手册
Anthropic 在官方博客发布两篇内部实践文章,《The AI-Native SDLC Playbook》讲 AI 承担多数编码工作时软件流程安排,《How Anthropic secures its AI-native software development lifecycle》谈流程自动化后安全体系建设。
来自MIT最强AI实验室:OpenAI天才华人研究员博士毕业了!
OpenAI华人研究科学家陈博远完成MIT博士论文答辩。他不到4年读完博士,辅修哲学,是GPT图像生成核心成员和Sora视频团队成员,将推进世界模型技术,强调视觉世界模型对具身智能至关重要。
ICML 2025 Oral | 从「浅对齐」到「深思熟虑」,清华牵头搭起大模型安全的下一级阶梯
在大语言模型加速进入高风险应用场景当下,“安全对齐”是挑战。如今广泛采用的“浅对齐”脆弱不堪。清华团队提出STAIR框架,能提升开源模型鲁棒性,还推出RealSafe - R1模型进行安全对齐。
Karpathy再放大招:8000行代码复现ChatGPT全栈,最低成本仅100美元,4小时跑完
Andrej Karpathy发布项目nanochat,是全栈式ChatGPT克隆体训练/推理流水线,代码约8000行,覆盖训练分词器、预训练等完整流程。介绍不同成本下模型表现,还回答网友关于架构、训练数据等问题。
一句“吴恩达说的”,就能让GPT-4o mini言听计从
宾夕法尼亚大学研究者发现,用恭维、同侪暗示等心理话术,能让GPT - 4o Mini突破安全底线。实验基于七大说服技巧,证明人类心理学原则可迁移至LLM。不过,此漏洞或被利用,已有团队尝试应对。
通义团队提出环境Scaling:自动构建环境,并自主学习和成长,可让30B比肩1T效果
阿里巴巴通义实验室团队论文提出通过程序化、自动化构建模拟环境,让语言模型自主交互学习。基于此训练的AgentScaler模型,数十亿参数就达万亿级模型性能,为轻量级代理智能发展带来新可能。
200K上下文突破:AI编程新星Augment崛起
AI编程新星Augment以65.4%的SWE - bench评分登顶榜首,估值超128亿美元。它能理解海量代码上下文,支持多环境集成。但新式AI编程工具存在安全风险,如Agent Memory恶意攻击等,文中给出应对建议。
刷新无监督异常检测上限!首提「匹配代价滤波for异常检测」范式 | ICML'25
新智元报道,东北大学等团队在ICML 2025提出CostFilter-AD,将「匹配代价体滤波」引入无监督异常检测,构建异常代价体并滤波,无需缺陷样本训练,可作插件提升现有系统,精准检测微小缺陷。
找到啦,我们已上车,Github 27000+ star,研发团队必备开源工具项目,真丝滑!!!
Trivy是开源安全扫描工具,支持扫描容器镜像等目标,识别CVE漏洞等风险。它有6大突出功能,技术优势明显,还给出使用示例、应用场景,与传统工具对比优势显著,适用于全生命周期安全分析。
如何定义“人味儿”?——HeartBench评测体系建设实践
在大模型竞争格局生变,情感智能评测缺失的背景下,作者团队发布聚焦AI拟人化的中文评测体系HeartBench,介绍其设计、评估方式、迭代过程等,还沉淀了评测体系构建方法论及专家标注管理思考。