安全测试」共找到 2497 篇相关文章

新闻资讯8

前沿模型被曝年度重大漏洞:加密思维链可被轻松提取,GPT,Claude,Gemini 无一幸免

一篇 116 页论文揭示前沿模型思维链重大安全漏洞,Anthropic、OpenAI、Google 的 API 因架构问题,模型隐藏推理过程可通过两次 API 调用被大规模提取,还会带来多种安全威胁。

AGI Hunt
产品应用8

Marvis 实测:6 个 AI“牛马”扎根桌面之后

作者实测腾讯 Marvis,它能实现终端调度、多 Agent 协同、跨模态任务链执行等。虽在编码、审美等方面有不足,但定位安全实用,适合普通用户,体现 AI 助手从对话工具向执行系统转变。

腾讯技术工程
推荐文章7

小模型代替顶级闭源:微软用4B小助理,砍掉30% Token消耗

微软研究团队提出实用方案,用4B参数的微型模型Terminus - 4B替换昂贵顶配大模型接管终端执行任务,采用SFT和RL策略打造子智能体,经测试效果良好,节省Token消耗。

AIGC开放社区
新闻资讯7

GPT-5.2降智遭全网差评!奥特曼慌了

OpenAI推出GPT - 5.2,却未打赢谷歌。第三方数据显示Gemini 3 Pro更优,GPT - 5.2在多项基准测试表现不佳,可信度不如GPT - 5.1,遭开发者吐槽。OpenAI为此调整策略,但仍处被动。

新智元
新闻资讯7

OpenAI 盲测新模型不如 Nano Banana Pro?曝 Altman 要暂停 Sora,死磕 ChatGPT

近日,网友发现 Notion 或在测试 GPT - 5.2。OpenAI 盲测新图像模型‘Chestnut’和‘Hazelnut’,结果接近 Nano Banana Pro,但生成图未获好评。Altman 调整战略,暂停 Sora 死磕 ChatGPT,本周将推 GPT - 5.2。

InfoQ
新闻资讯8

刚刚,Claude Sonnet 4.5重磅发布,编程新王降临!

北京时间今天凌晨,Anthropic发布Claude Sonnet 4.5,被定义为全球最强代码模型。它在多方面有显著突破,Anthropic还对全线产品更新,其在多项测试表现出色,且对齐性更好、更安全

新智元
新闻资讯7

直播预约 | Transformer 模型能否通过连接训练数据中的离散知识进行推理?

为研究Transformer是否具备组合式推理能力,提出FTCT合成任务。实验发现Few - shot CoT提示可激发推理能力,训练与测试相似度、模型复杂度影响推理能力。还分析了其内在机制,展示其泛化推理潜力。

深度学习自然语言处理
新闻资讯7

GPT-5系统提示词突遭泄露,17803 token曝光OpenAI小心思!

一份全新GPT - 5系统提示词在GitHub泄露,有17803 token。此提示词设计精细,覆盖用户对齐、拟人风格、输出质量等。还展示了通用关键要求、安全对齐等方面内容。

新智元
新闻资讯7

汽车MCU的“芯”浪潮

在汽车产业变革下,汽车MCU作为核心控制部件迎来创新升级。AI浪潮让其算力狂飙,架构革新提升集成度,同时安全成新重点。未来,汽车MCU将更智能高效,融合AI、创新架构、重视安全

芯师爷
开源动态8

陶哲轩转发!DeepMind开源「AI数学证明标准习题集」

DeepMind开源形式化数学猜想库,收录经典数学猜想,还提供代码函数方便形式化表述。此库可作测试基准提升AI数学推理能力,是AI+ATP范式关键前置步骤,团队邀更多人参与丰富内容。

量子位