前端自动化测试」共找到 2239 篇相关文章

开源动态7

Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板

Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。

InfoQ
算法论文8

BIGAI & 中科大团队提出 MILR: 测试时隐空间推理,让图像生成学会「边想边改」丨ICLR 2026

BIGAI与中科大等团队提出MILR,通过测试时隐空间推理,在不更新模型参数下优化图文表示,提升复杂图像生成能力。该方法在多基准测试达SOTA,还探讨了测试时扩展与奖励模型,未来有诸多拓展方向。

AI科技评论
产品应用7

Anthropic重磅更新skill-creator:创建skill全面告别“草台班子”时代

Anthropic升级skill - creator,让普通人创建skill更友好且有效。将测试等机制引入创作,能验证skill有效性。还支持多智能体并行测试、A/B测试,优化触发描述,为未来自然语言定义skill过渡。

AI寒武纪
开源动态7

Cloudflare 如何解决了 quiche 中的一个拥塞漏洞

Cloudflare 分享发现 CUBIC 的 Rust 实现问题,该问题影响开源库 quiche。团队构建模拟环境测试,发现 CUBIC 陷入恢复循环,用 Reno 测试排除广泛问题,最终一行代码修复,使测试通过率达 100%。

InfoQ
新闻资讯7

Grok 4刷新ARC-AGI-2纪录:15.9%碾压所有公开模型,我们离AGI还有多远?

xAI的Grok 4在ARC-AGI-2测试中获15.9%,成全球最强公开AI模型。ARC Prize主席还原测试过程,虽成绩亮眼,但网友有质疑,且离人类表现差距大。Grok 4在多基准测试领先,定价便宜。

AGI Hunt
新闻资讯8

昂瑞微IPO:以战略定力穿越周期,构建射频前端国产化新范式

在全球半导体行业波动与技术创新背景下,昂瑞微IPO受关注。它技术攻坚突破L - PAMiD,构建‘双轮驱动’,布局车载与卫星通信新赛道,以战略定力穿越周期,为国产芯片发展注入活力。

芯师爷
开源动态8

突然猛涨7K+ star!阿里开源的前端增强项目火了!

阿里开源的前端增强项目 PageAgent 火了,在 GitHub 获 8k+ star。它是纯前端 JavaScript GUI 智能体框架,可让网页拥有 AI Agent,通过自然语言控制界面,有自动填表单等功能,使用简单。

开源先锋
开源动态8

阿里开源Mobile-Agent-v3:多模态GUI智能体,实现跨平台自动化突破!

全新自动化时代,GUI智能体融入日常。阿里巴巴通义实验室推出GUI - Owl与Mobile - Agent - v3,实现跨平台自动化突破。文章解析其发展历程、技术创新,且项目开源,商业化潜力引关注。

AIGC开放社区
产品应用8

全球首个从语言出发构建的智能体:MoonBit Pilot 如何推动自动化软件交付?

MoonBit Pilot是从语言底层构建的代码智能体系统,将AI Agent从“助手”推向“合作者”。它比Cursor、Codex更快更稳定,能云端异步执行,有Sub Agent架构和分段编译机制,或成未来软件工业新标准。

AI科技评论
开源动态8

“零人”搞医学研究:清华AI智能体从灵感到论文全程自主

清华大学自动化系索津莉课题组发布全自主AI研究框架OpenLens AI,实现医学研究全链条自动化闭环,解决医疗信息学研究效率困局,将科研周期从“月级”缩至“小时级”,还在质量控制上设新标杆。

量子位