智能体安全评估」共找到 4635 篇相关文章

算法论文8

Google | 溯源分析RAG系统错误,提出选择性生成框架,让RAG问答准确率提升10%

Google对RAG系统错误深入分析,引入‘充分上下文’概念,指出幻觉或因上下文不足。构建评估器,提出选择性生成框架,结合多信号决策,实验显示可让RAG问答准确率最高提升10%。

AINLPer
新闻资讯7

「AI 100」榜单启动招募,AI产品“年会”不能停丨量子位智库

2025年国内AI产品关键词频现,各有代表性产品。量子位智库2025年度「AI 100」榜单开启招募,分三大板块,用定量与定性结合评估体系,还公开AI产品知识库。

量子位
推荐文章7

DeepSeek 复盘:128 天后,为什么用户流量一直在下跌?

文章深入分析DeepSeek和Anthropic策略,揭示行业计算资源稀缺难题。指出AI服务定价是延迟、吞吐量、上下文窗口三个指标的权衡,DeepSeek牺牲体验换研发,Anthropic提升‘智能密度’优化资源。

Founder Park
推荐文章8

最权威的Skills编写指南来了!33页,Anthropic亲自发布

Anthropic发布33页《Skills编写完整指南》。Skills能为智能体注入行业经验与工作流,实现复杂任务自动化。指南梳理了编写逻辑,涵盖定制、构思、测试、发布等全生命周期内容。

AIGC开放社区
新闻资讯8

OpenAI十周年「血色浪漫」:11位联创出走8位,奥特曼深夜发文

OpenAI迎来十周年,发布短片回顾发展。过去11位联创出走8位,奥特曼发文揭秘细节,称吃到时代红利。新晋女高管分享炼成秘诀,如研究驱动产品、自下而上创新、重视安全等。

新智元
开源动态8

HexStrike代理:让大模型继承专家经验,显著提升渗透测试效率

HexStrike是开源渗透测试工具,以MCP为底座。其核心智能组件IntelligentDecisionEngine是专家系统,将安全专家经验规则化,通过知识库和算法提供工具选择和参数优化,提升渗透测试效率。

AI与安全
推荐文章8

吴恩达来信:当防护机制出问题时

本周,闭源模型用户意外发动网络攻击,闭源模型因防护机制无法协助防御,开放模型 GLM 5.2 却助力应对。吴恩达认为应重视模型使用的责任,开放模型能让技术更透明安全

DeeplearningAI
算法论文8

DMLR 2026 | RPI Shaowu Pan(潘韶武)团队 Nithin Somasekharan等:CFDLLMBench——首个面向计算流体力学的大语言模型综合基准评测

文章介绍针对CFD领域的综合LLM评测基准CFDLLMBench,构建三层递进挑战体系。实验揭示主流LLM在‘知道’与‘做到’间有差距,多智能体框架可提升成功率,代码与数据集已开源。

力学与人工智能
新闻资讯7

Claude最新模型Mythos意外泄露,性能远超Opus

Anthropic内容管理系统配置失误,近3000个未发布资产泄露,Claude最新模型Mythos提前公开。它在软件编码、学术推理和网络安全等测试中远超Opus,网络安全能力尤其危险。2026年初Anthropic产品密集发布。

开源AI项目落地
新闻资讯7

第一批“首席龙虾官”,月薪6万

当下不少公司热招“龙虾官”,涵盖AI、医疗、房地产等多行业,薪资优厚。“首席龙虾官”负责推动公司AI Native转型,还有OpenClaw开发工程师等岗位,大模型、智能体技术正改变工作方式。

量子位