「大模型安全」共找到 9779 篇相关文章
Claude Code 工程师:像 Agent 一样思考
Anthropic 工程师 Thariq 分享构建 Claude Code 时 Agent 工具设计经验,通过 AskUserQuestion 工具迭代、Todo List 到 Task 系统演进等案例,指出工具设计无标准答案,要观察模型行为、反复实验。
DeepMind 提出 CaMeL,抵御 LLM 提示词注入
谷歌DeepMind研究人员提出CaMeL,作为围绕LLM的防御层,通过提取查询中的控制流和数据流阻止恶意输入,能在AgentDojo基准测试中抵御67%攻击,采用传统软件安全原则。
上交博士最新思考:仅用两个问题讲清强化学习
上交博士 Kun Lei 博客提出用两个问题理解强化学习:数据从哪来、策略更新多频繁。借此梳理算法逻辑,还延伸到机器人基础模型,指出训练节奏与其实践契合。
人在美国,待过三家AI Lab,全凉了!
科技行业大裁员,Meta裁掉老将田渊栋,AI从业者人心惶惶。南洋理工大学副教授Boyang Li工作过的三家工业研究实验室全倒闭,他分享经历,探讨工业研究困难的原因。
刚刚,Anthropic 成立了个 AI精神病学团队,正在招人
Anthropic宣布成立「AI精神病学」团队,作为可解释性研究一部分,将研究模型人格、动机等致其行为异常的因素。团队现正招聘研究科学家,不过此举措也引发争议。
养虾「不可能三角」:好用、好玩、安全,复旦这个「00后」团队做到了!
2026 开年,OpenClaw 带来的 Agent 热度扩散,但安全问题凸显。复旦大学马兴军老师团队开源 XSafeClaw,将安全监控等前移到可视化界面,实现 Agent 全生命周期监控,还注重界面设计,让技术更易被接受。
刚刚,Yann LeCun官宣离职创业,瞄准高级机器智能AMI
图灵奖得主Yann LeCun宣布离职Meta创业,新公司聚焦高级机器智能(AMI),继续其“世界模型”研究。他是LLM批评者,认为其无法理解物理世界,新公司目标推动AI重大革命。
微软开源AI量化投资神器,狂揽23.5K星标,一站式打造你的智能交易系统!
量化投资结合AI成金融新趋势,但构建完整量化流程难题多。微软开源的Qlib平台是领军者,基于Python覆盖全流程,支持30+模型,数据引擎快,功能亮点多,安装方式多样。
我国的智算中心布局
结合民生证券报告和AIDC调研纪要,分析我国数据中心市场。全球数据中心建设将增长,新增容量约85%投向智算中心。中国智算中心大头在中西部,还介绍了国内投资主体格局。
优步针对微服务和大规模计算工作负载完成了大规模的 Kubernetes 迁移
优步成功将计算平台从 Apache Mesos 迁至 Kubernetes,覆盖多数据中心和云环境。工程团队详述迁移挑战、方案与教训。虽遇技术、文化难题,但迁移后运营效率等提升,为大公司提供借鉴。