「安全评估」共找到 1560 篇相关文章
菲尔兹奖得主预警:AI可能杀死数学!
今年菲尔兹奖得主多伦多大学教授Jacob Tsimerman宣布加入OpenAI从事AI安全研究,因其认为2年内AI将在数学证明领域超越人类。陶哲轩、Timothy Gowers等也对此表示担忧。《莱顿宣言》发布,众多数学家签名抵制AI对数学的冲击。
Agent开始“自我进化”:会出题、会反思,还会自己长出新技能
文章围绕自进化Agent展开,介绍其概念、受重视原因及三大技术路线,涵盖各路线代表工作的特点、评估及对比,指出研究空白如总结者训练等,最后还介绍了基于Agentic AI的全链路数据助手Dola。
Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板
Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。
全国首部“数据流通交易合规”标准,现公开征集起草单位和专家!
2026年是数据要素价值释放年,数据资产交易却面临合规与安全难题。中国电子商会归口、智合标准中心组织编制《企业数据要素流通交易合规指南》团体标准,涵盖多核心模块,有三大亮点,现征集起草单位和专家。
当每个人都能指挥一支 AI 大军,什么能力最重要?
文章指出,在AI Agent增多的时代,管理能力是驾驭它们的关键。沃顿商学院教授提出判断是否委派任务给AI的公式,还建议从更好的指令、评估、反馈三方面提高成功率,同时给出委托任务和锻炼管理能力的方法。
喊话特朗普重视AI风险,Anthropic CEO万字长文写应对方案,这方案也是Claude辅助完成的
Anthropic联合创始人兼CEO Dario Amodei写万字长文《技术的青春期》,指出AI飞速迭代下人类面临的危险局面,可能带来国家级安全威胁。文中阐述AI五大系统性风险,并给出应对方案,强调人类制度和成熟度要跟上AI发展。
2025 智能体元年,Agent 开发平台深度评测报告解读
2025 年 AI 产业两大核心趋势并行,AI Agent 产业化落地提速。国家工业信息安全发展研究中心赛昇实验室发布评测报告,对阿里云百炼等四大 Agent 开发平台从 RAG、工作流能力、Agent 工具调用三大维度测试,为行业选型提供参考。
Agnes:不做通用型智能体丨对话全民AI应用平台Agnes AI
量子位智库对话Agnes AI创始人Bruce Yang,探讨多智能体在AI产品的应用。Agnes AI以Multi Agent架构为核心,上线四月日活破20万。其介绍了核心功能、单多智能体差异、评估维度等,还谈及目标人群、市场规模等内容。
Codeforces难题不够刷?谢赛宁等造了个AI出题机,能生成原创编程题
LiveCodeBench Pro团队推出AutoCode框架,利用LLM自动化竞赛编程问题创建与评估。该框架结合验证器 - 生成器 - 检查器框架与双重验证协议,在测试用例生成上可靠性佳,还能生成新问题,同时揭示了LLM在创作上的优劣势。
AI驱动的开源攻击框架:HexStrike-AI
HexStrike-AI是安全研究员开发的开源攻击框架,2025年7月起在GitHub免费提供。它基于MCP协议,集成LLM与150多种工具,可自动化渗透测试和漏洞发现。曾被网络犯罪分子利用,能加速攻击流程,展现强适应和并行化能力。