测试全流程」共找到 3872 篇相关文章

开源动态8

测试时也能RL,英伟达等提出新范式:TTT-Discover

近日,斯坦福、英伟达、Together AI 等联合开源测试时新范式 TTT - Discover,在测试阶段用强化学习微调模型,以刷出 single best 结果,用几百美元就刷新诸多领域 SOTA。

PaperAgent
开源动态8

MetaGPT 用户智能体发布,开启端到端自主软件测试新范式!

当前AI软件领域代码生成智能化发展快,但测试验收仍靠手动,效率低。MetaGPT推出用户智能体,研究团队发布RealDevWorld框架和AppEvalPilot实现端到端自动化评测,解决复杂软件质量评估难题。

特工宇宙
新闻资讯8

刚刚,GPT-5首次通过「哥德尔测试」!破解三大数学猜想

GPT - 5首次通过「哥德尔测试」,破解三大组合优化猜想。研究由海法大学和思科主导,团队设计五项测试任务,GPT - 5在三个简单问题上近乎完美,还推导出不同解法,标志AI从「学习数学」迈向「做数学」。

新智元
新闻资讯7

OpenAI 收购 A/B 测试新秀Statsig :印度裔创始人出任应用CTO,执掌 ChatGPT 产品工程

OpenAI宣布收购A/B测试巨头Statsig,其创始人Vijaye Raji将任应用部门CTO,负责ChatGPT等产品工程。Statsig为企业提供A/B测试等服务,收购将增强OpenAI实验能力。

AI寒武纪
产品应用8

360安云架构解,AI智能体如何开启「主驾」新时代?

AI发展加速,网络安危机加剧。360安云在ISC.AI 2025大会发布新产品,提出“安即服务”理念,打造AI驱动的四层架构,发布三大类智能体,为企业提供生命周期价值交付的安服务。

甲子光年
产品应用7

如何让AI帮你做前端自动化测试?我们这样落地了

本文介绍阿里基于AI的UI自动化测试框架在专有云质量保障的实践。框架用开源browser - use等工具,采用自然语言驱动用例、动态元素定位等机制,还应对了大模型幻觉等挑战,也提及构建企业级数据分析Agent方案。

阿里云开发者
新闻资讯7

Claude Code 生成 13 种编程语言代码基准测试:动态语言更快更省成本

Ruby 代码提交者远藤裕介评估 Claude Code 用 13 种编程语言生成代码的效率。经 600 多次测试,动态语言更快、更省成本且更稳定,静态类型语言慢且成本高。实验有局限,也引发质疑与回应。

InfoQ
推荐文章8

AIGC生命周期业务风控白皮书,从备案到运营的合规与安实践

2025年《人工智能安治理框架》2.0版发布,凸显AI安重要性。数美科技发布《AIGC生命周期业务风控白皮书》,构建生命周期业务风控体系,涵盖备案攻略、评测要点、账号与内容风控等,还有实战案例。

InfoQ
产品应用7

Cloudflare 发布 Dynamic Workers 公开测试版:基于 Isolates 的沙箱环境执行 AI 智能体代码

Cloudflare 推出 Dynamic Worker 公开测试版,面向付费用户。它用 V8 Isolates 运行代码,启动快、内存效率高,基于 Code Mode 理念,用 TypeScript 接口定义 API,有多种防护策略,还发布配套库,已用于生产。

AI前线
新闻资讯8

大模型七连发,外国人馋透了!阿里云栖大会栈升级够狠

阿里在2025云栖大会栈升级,发布七款通义新模型,从基础大模型到各专项领域覆盖。旗舰模型Qwen3 - Max性能超GPT - 5等,新架构Qwen3 - Next实现效率突破,多模型开源且表现出色。

机器之心