「安全评测」共找到 1495 篇相关文章
Tair 短期记忆架构实践:淘宝闪购 AI Agent 的秒级响应记忆系统
本文从淘宝闪购与千问合作的‘一句话点外卖’项目出发,介绍 Tair 在 AI Agent 记忆管理中的数据模型设计、压缩策略与并发控制等关键实践,展示其在低延迟、数据建模、并发安全和弹性抗压等方面的能力。
A2A:多智能体的协作总线
文章介绍了A2A协议,它是多智能体系统的“协作总线”,能让不同智能体安全高效协作。阐述其核心使命、与MCP区别、核心概念、工作流实例,还描绘了“智能体社会”愿景,并给出基于官方文档的实现示例。
硅谷刷屏的ClawdBot,让Mac mini卖爆了!创始人爆料:一人开发、100% AI 写代码,全开源却留 0.00001% 给全网来 hack
个人 AI 助手 ClawdBot 席卷硅谷,网友评价高,项目已开源获 20.8k stars。它几乎 100% 用 AI 写代码,协作方式激进,创始人还留 0.00001% 作为“安全靶子”。其功能强大但有安全隐患,还带火了 Mac Mini。
准确率腰斩!大模型视觉能力一出日常生活就「失灵」
EgoCross项目团队聚焦跨域第一视角视频问答评测,揭示现有MLLM在多场景泛化瓶颈。团队提出跨域第一视角视频问答基准EgoCross,经测试揭示模型短板,验证改进方法潜力,研究入选AAAI 2026且数据集等已开源。
顶会SOSP'25最佳论文,被一个国产自研操作系统拿下
国产自研开源操作系统星绽的学术论文获顶会SOSP'25最佳论文。它专注高可扩展内存管理研究,兼顾性能与安全。星绽由多单位联合研发,用Rust语言,解决传统系统难题,已有多篇论文被国际顶级学术会议录用。
最强DeepResearch!通义DeepResearch-30B开源实战:模型部署+LangGraph+A2A全攻略
阿里发布全开源项目通义DeepResearch,在研究任务评测中表现出色,底层是30B的MoE专用推理模型,资源需求低。文章演示了基于该项目构建本地化端到端DeepResearch助理的方法,包括模型部署、Agent实现等。
“AI版LeCun”自己讲解论文,自我进化智能体框架生成精美演讲视频
加州大学研究者提出自我进化的学术演讲智能体框架EvoPresent,它由四个智能体协作,核心美学模型PresAesth模拟人类审美判断。团队构建评测体系,实验显示其在内容与视觉设计上提升显著,让AI兼顾逻辑与美感。
开源仅一周,鹅厂文生图大模型强势登顶,击败谷歌Nano-Banana
腾讯混元团队开源的原生多模态生图模型混元图像 3.0,开源仅一周就在国际权威评测榜单 LMArena 上超越谷歌 Nano - Banana 等,位列文生图综合和开源榜单第一。实测表现出色,技术上也有诸多创新。
LLM应用测试范式的进化
文章指出传统软件测试方法在LLM应用中存局限,探讨将其与AI评估结合应对挑战。抽象出LLM应用三层架构模型,分析传统测试范式适用性,介绍AI安全分析方法,阐述测试挑战、范式转变及协同测试策略。
先验+后验加持,大模型能否 hold 住推理预测的现实「溢出」?
多数大模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,大模型在现实场景运用仍待优化。