攻击测试」共找到 1851 篇相关文章

新闻资讯7

刚刚,ARC-AGI-3发布!人类100分,最强AI零分

ARC Prize发布ARC - AGI - 3预览版,测试范式从静态谜题到交互式游戏。新引入交互式推理基准测试,人类轻松通关,最强AI却全军覆没。但测试引发社区质疑,奖金设置也遭吐槽,且存在体验和技术问题。

AGI Hunt
新闻资讯7

企业广泛采用 Agentic AI,但领导层理解滞后

Sauce Labs调查显示,97%公司采用或计划采用Agentic AI用于测试,但61%领导层不完全了解软件测试需求。调查揭示矛盾现象,如受访者既看好自主测试又对数据访问不安。还指出团队与高管期望有差异,需解决不一致。

InfoQ
开源动态7

Correlations:氛围测试你的向量模型

Jina AI分享内部调试可视化向量小工具Correlations,它能生成交互式热图展示内容间余弦相似度,提供多种交互方式。工具已在GitHub开源,适用于内容去重、验证引文等场景。

Jina AI
新闻资讯7

谁是最强“打工AI”?OpenAI亲自测试,结果第一不是自己

OpenAI发布新研究,提出GDPval基准衡量AI模型在有经济价值任务上的表现。Claude Opus 4.1表现最佳,GPT - 5次之。OpenAI开源优质子集并提供自动评分服务,还指出了GDPval的局限。

量子位
8

我们测试了百度的「AI 科学家」,它正在悄悄淘汰算法工程师

百度 2025 世界大会亮相的「伐谋」,是全球领先可商用自我演化超级智能体。它源于进化论,能让算法自我进化。实测显示其在生活场景和复杂决策问题上表现优越,架构精巧,将推动算法研发普惠化。

特工宇宙
算法论文8

OpenAI、Anthropic、DeepMind联手发文:现有LLM安全防御不堪一击

OpenAI、Anthropic、Google DeepMind 联手发文,研究语言模型安全防御评估。指出现有防御评估有缺陷,提出通用自适应攻击框架,成功绕过 12 种防御机制,多数攻击成功率超 90%。

机器之心
算法论文8

MIT成果登Nature正刊:90天,「AI科学家」完成3500次电化学测试

美国麻省理工学院李巨团队在Nature发表论文,展示多模态机器人平台CRESt。它结合多模态模型驱动的材料设计与高通量自动化实验,大幅提升催化剂研发速度和质量,还解决了实验结果可重复性不足问题。

新智元
新闻资讯8

Anthropic 研究发现:仅需少量污染文档即可对 LLM 实施投毒

Anthropic的Alignment Science团队研究大语言模型训练投毒攻击,实验发现仅250条恶意样本就能植入“后门”,且模型越大攻击越易,还对微调数据集实验,引发讨论。

InfoQ
推荐文章8

Agent失忆怎么办,Anthropic教你做好工作交接

文章指出AI Agent跨上下文窗口执行长任务时易失败,Anthropic用Opus 4.5实验发现,问题根源是交接差。解决办法是让Agent像人类工程师一样留文档、进度和测试,拆分流程,严格规范,提升测试覆盖率。

CourseAI
算法论文8

“这个怎么组装?”一句无害的问题,如何让AI产生危险输出

Amazon团队发现全新威胁模型“视觉排他性”,提出MM - Plan框架,通过强化学习训练智能体自动发现攻击策略。实验显示其对Claude 4.5 Sonnet和GPT - 5攻击成功率可观,代码和数据集已开源。

深度学习自然语言处理