「自动化评估工具」共找到 2864 篇相关文章
MetaGPT 用户智能体发布,开启端到端自主软件测试新范式!
当前AI软件领域代码生成智能化发展快,但测试验收仍靠手动,效率低。MetaGPT推出用户智能体,研究团队发布RealDevWorld框架和AppEvalPilot实现端到端自动化评测,解决复杂软件质量评估难题。
本周推荐的5个超级6的Github开源项目!
本周推荐5个超棒的Github开源项目,有基于Nginx的可视化管理面板、全能型浏览器自动化框架、容器命令行版“任务管理器”、命令行知识管理工具,还有GitHub汉化浏览器插件,各有强大功能和特色。
Agent全自动搭建代码运行环境,实时更新解决评测过拟合/数据污染问题|微软
长期以来主流代码修复评测基准SWE - bench问题多,制约AI模型能力展现。微软发布SWE - bench - Live,引入新Issue,实现环境自动化构建与更新,打破传统局限,还揭示传统基准过拟合问题。
Shopify 经验贴:如何搞出一个生产级别可用的 AI Agent 系统?
Shopify 以 AI 助手 Sidekick 为例,分享从简单工具调用系统演变为复杂 AI Agent 平台的经验,包括架构设计、评估方法和训练技术等方面,还给出构建生产级别可用的 AI Agent 系统的四条核心建议。
多个编码智能体同时使用会不会混乱?海外开发者热议
AI编程工具进步快,GPT - 5等模型推动开发自动化。编码智能体成开发常态,但存在问题。独立开源开发者Simon Willison分享并行使用多个编码智能体经验,引发海外开发者热议。
19岁小哥伯克利辍学创业,获2800万美元融资,OpenAI投了
由两位加州大学伯克利分校辍学生创立的营销自动化创业公司 Conversion,7月30日宣布获2800万美元A轮融资,OpenAI等参与投资。该公司将AI深度集成,定位企业增长引擎,虽赛道竞争激烈,但创始人自信满满。
Vibe Coding 方法论:不会编程的人如何用 AI 写出能跑的代码
文章介绍 Vibe Coding 方法论,即便不会编程,也能用 AI 写出能跑的代码。核心是把需求说清楚,还可小步迭代开发,Claude 这类会主动询问的工具更适用,同时要明确其适用场景。
76%程序员依赖AI?代码安全挑战解析
GitHub报告显示76%程序员用AI编程,代码安全成挑战。腾讯等团队建A.S.E评测框架,有项目级代码生成等优势,能评估代码安全、质量与稳定性,未来将扩充功能,邀开发者参与。
ICLR-26腾讯混元:Agent是强大的,但用户是狂野的
现有LLM工具使用基准测试场景理想化,忽视真实用户行为复杂性。腾讯提出WildToolBench,基于真实用户行为构建测试集,对58个模型评估,发现模型准确率低,揭示LLM在真实场景下能力缺口,为模型优化指明方向。
OpenAI与Anthropic罕见合作:竞争对手联手测试AI安全
OpenAI和Anthropic完成联合评估,用内部工具测对方模型并公开结果。测试覆盖指令层级、越狱等四大领域,还发现不少细节和道德困境情况。此次合作意义重大,为行业树立安全合作先例。