前端自动化测试」共找到 2236 篇相关文章

开源动态8

18K+标星!视觉AI驱动的浏览器自动化,告别XPath,无惧网页改版!

网页自动化常遇页面更新脚本报废等难题,而开源工具Skyvern不走传统XPath/DOM路子,用视觉+大语言模型理解网页,能自适应改版,功能丰富,安装运行简单。

开源星探
产品应用7

为 OpenAI 秘密提供模型测试, OpenRouter 给 LLMs 做了套“网关系统”

OpenRouter成立于2023年初,为用户提供统一API Key调用各类模型,OpenAI会用其秘密测试。平台token用量高速增长,还发布模型用量排行榜引关注。创始人认为大模型非赢家通吃,未来想成agent最佳推理层。

海外独角兽
开源动态7

用于评估AI Web渗透测试能力的工具:XBow Bechmark,比靶机更好

文章介绍了用于评估AI Web渗透测试能力的XBow Benchmark,它已在github开源。该基准含104个Web安全挑战,涵盖多种漏洞,设计确保可重复性和状态持久性,其评估能力获广泛认可,还介绍了开源内容等。

AI与安全
产品应用7

从需求到研发全自动:如何基于Multi-Agent架构打造AI前端工程师

本文介绍蚂蚁消金前端团队打造的Multi - Agent智能体平台“天工万象”。阐述其技术实践,对比多Agent与统一型Agent、ReAct范式与固定工作流优劣,还介绍专业智能体建设,分享开发中的思考与经验。

阿里云开发者
算法论文7

智能体自己出现问题自己找!首次提出“自动化失败归因”课题 | ICML2025 Spotlight

LLM Multi - Agent系统失败诊断难,阻碍迭代优化。宾夕法尼亚州立大学等机构研究者首次提出“自动化失败归因”课题,构建Who&When数据集,开发评估多种归因方法,实验揭示当前方法不足。

量子位
算法论文8

迈向无缝共生:大模型GUI Agent的「屏幕图灵测试」与拟人化之路

多模态大模型使GUI Agent能模拟用户执行任务,但也引发与平台的利益冲突。论文提出“屏幕图灵测试”和AHB基准评估拟人化能力,探讨拟人化策略及权衡,为Agent在数字世界共生提供指南。

AI科技评论
推荐文章8

AI 开发时代的“能力暴露与禁止空间”方法论:TPDD 与高层测试闭环

文章指出大模型加速软件开发范式演进,AI 深度介入开发带来新生产路径,但也放大风险。作者提出 TPDD 方法论,通过提前定义测试点与边界条件,平衡能力利用与风险控制,确保系统可控、安全、可持续。

InfoQ
算法论文8

破解MoE模型“规模越大,效率越低”困境!中科院自动化所提出新框架

大模型参数量飙升却陷入‘规模越大,效率越低’困境,中科院自动化所研究团队提出统一框架,直击MoE底层运作模式,让专家‘组队学习’,实现参数量、负载方差降低,达成三重优化。

量子位
推荐文章8

把 UI 生成接进流水线:基于半监督评测体系的 UI 自动化生产实践

本文来自蚂蚁集团黄兆嵩在 QCon 2026 的演讲,探讨生成式 UI 技术重塑生产方式。提出系列工程实践,包括高质量生成、LUI 场景应用及质量监控迭代,让前端生产自动运转、用户体验随需而变。

InfoQ
开源动态8

“设计师的 Cursor”!拖拖拽拽就能做前端,AI 实时生成代码,代码设计双向同步!

Onlook是号称‘设计师的Cursor’的开源工具,可让用户在浏览器可视化构建前端界面,通过AI驱动双向绑定实现设计与代码实时同步,还具备多项核心功能,适用于多种场景,解决设计与开发痛点。

开源星探