「漏洞评估」共找到 885 篇相关文章
Claude和GPT思维链竟被两步蒸馏!116页论文曝光API致命漏洞
2026年AI蒸馏成悬案,一篇116页论文砸穿巨头「黑盒」。研究人员用低价小模型恢复Claude、GPT和Gemini原始推理,还发现API漏洞存在跨会话、用户和模型互通情况,收集公开轨迹泄露诸多敏感信息。
大模型转行土木工程!首个「打灰人」评估基准:检验读、改工程图纸能力
首个工程自动化任务评估基准DrafterBench,可测试大模型在土木工程图纸修改任务中的表现。它模拟真实工程命令,考察模型四方面能力。评测发现主流大模型有一定能力,但未达工程一线要求。
姚顺雨署名:大模型「现学现卖」能力首次被系统评估,腾讯、复旦联手发布CL-Bench
腾讯混元团队和复旦大学研究人员联手推出全新基准测试CL - Bench,系统性评估大模型上下文学习能力。测试显示十大前沿模型表现不佳,揭示当前大模型在该能力上的普遍短板,并指出未来四个探索方向。
a16z:AI 产品初期用户流失高很正常,M3 留存才是评估 PMF 的关键
a16z研究团队分析数百家AI企业后发现,将衡量用户留存率基准点从M0后移至M3,能更清晰评估PMF和GTM策略。AI产品留存曲线分获客、留存、扩张三阶段,M12/M3比率是预测长期留存关键指标。
AI证伪百年数学猜想被打假!Lean证明惊现漏洞,哥大教授破防了
OpenAI新推理模型取得十项数学进展,如证明非Sofic群存在性等。哥伦比亚大学副教授Henry Yuen对其量子并行重复定理证明既兴奋又失望,因证明有AI味且难理解。此外,Lean证伪科拉兹猜想被指利用内核漏洞,专家提醒Lean验证有局限。
5700问答对全面评估拷问AI空间感!最新空间智能评测基准来了丨浙大&成电&港中文
当前视觉语言大模型空间信息学习片段化,缺乏多维度空间推理能力。浙大、成电和港中文团队提出ViewSpatial - Bench基准体系,评估主流模型,揭示其缺陷,并开发MVSM优化跨视角空间理解。
模型即智能体,Kimi K2 Thinking多项评估超越顶尖闭源模型,300轮工具调用不疲倦
月之暗面发布Kimi K2 Thinking,它是Kimi迄今最强开源思考模型,基于模型即智能体理念训练,可自主连续工具调用与多轮思考,多项评估超顶尖闭源模型,还实现原生INT4量化,提升生成速度。
面对无解问题大模型竟会崩溃?港中文&华为联合提出首个大模型推理可靠性评估基准
港中文和华为诺亚实验室联合提出ReliableMath基准,探究大模型推理可靠性。提出评估准则,构建含可解与不可解问题的ReliableMath数据集,实验揭示大模型缺陷,还提出提高可靠性的对齐策略。
会挖0-day漏洞!凶残版Claude官宣却不让用,微软苹果齐下场“看守”,Anthropic到底在图什么?
Anthropic官宣Mythos Preview,却未将其放给普通人用,而是塞进防御联盟Glasswing。Mythos在漏洞发现和利用上能力超多数人类,Anthropic怕其引发风险,先将它组织进防守体系,还试图占据‘负责任的frontier lab’位置。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。