Agentic软件测试」共找到 4502 篇相关文章

推荐文章8

拼交付、主动找活干,3 月我们推荐这 18 款 Agent 产品

3月是AI产品发布密集期,出现一批主动干活的Agent产品。文章介绍18款产品,如Claude系列升级为个人AI操作系统,OpenClaw生态涌现多种商业形态,还有垂直场景Agent及上下文感知等产品。

Founder Park
开源动态7

Claude Code完整技术栈都被扒出来了,Multi-Agent架构~

analysis_claude_code项目对Claude Code v1.0.33逆向工程分析,含混淆代码技术分析等。发现实时Steering机制、多Agent架构等,为AI agent系统设计实现提供技术参考,还介绍系统架构创新点。

PaperAgent
推荐文章8

Karpathy提的“软件3.0”已过时,交互即智能才是未来 | 上交大&创智刘鹏飞

上海交通大学刘鹏飞团队认为,2024年9月后,大神Karpathy提出的“软件3.0”已过时,“软件3.5”应运而生。其核心是“交互即智能”,在自然语言易用性基础上实现人机交互认知层面突破。

量子位
开源动态8

拆箱开源版Coze:Agent核心三件套大公开,48小时揽下9K Star

扣子两款子产品扣子开发平台和扣子罗盘近期开源,加上此前开源的开发框架Eino,覆盖了Agent开发全链路。其采用宽松的Apache 2.0开源协议,降低开发门槛,有望带动Agent在更多场景落地。

量子位
开源动态7

视频推理界的“福尔摩斯测试”:所有大模型,统统不及格 | 论文代码开源

腾讯ARC Lab和香港城市大学推出Video - Holmes,这是视频推理界的‘福尔摩斯测试’,能展现多模态大模型复杂视频推理能力的边界,规避现有Benchmark痛点,测试中所有大模型全部不及格,代码已开源。

量子位
开源动态7

DeepSeek新模型DeepSeek-V4-Lite-285B测试曝光:“大海捞针”召回率100%

社区消息显示DeepSeek正测试新模型DeepSeek - V4 - Lite - 285B,用OpenAI MRCR 8 - pin标准考察超长上下文信息检索能力。测试结果优异,但‘大海捞针’法或被DSA作弊,实际效果存疑,社区高度关注其进展。

AI工程化
算法论文8

UIUC清华微软联合提出PlugMem:当Agent记忆告别「经历」,开始存储「经验」

随着大语言模型Agent长期运行,‘记忆该如何设计’成核心问题。UIUC、清华、微软联合提出PlugMem,将记忆拆分为三类,以知识为单位存储,在三类任务中验证其有效性,为Agent长期记忆设计提供新思路。

机器之心
新闻资讯7

陶哲轩回应OpenAI新模型IMO夺金!GPT-5测试版也曝光了

OpenAI新模型在2025年IMO达金牌水平,GPT - 5也将发布。但陶哲轩指出缺乏统一测试标准,影响公平比较。MathArena测试中,Gemini 2.5 Pro仅13分,远低于铜牌线。

量子位
产品应用8

一款产品,同时为人类和 Agent 设计,LibTV 是怎么做的?

3月18日,LiblibAI旗下AI视频创作平台LibTV上线,它从设计之初就兼顾人类创作者和Agent。创作者端工作流画布可控;Agent端可通过Skill接口创作,交付可编辑项目。该产品还针对两者差异做了设计,价格也便宜。

Founder Park
产品应用8

新模型亦是新 Agent,Kimi-Researcher 超大量一手实测!

2025 年被称为“Agent 元年”,月之暗面发布了端到端强化学习训练的新一代 Agent 模型 Kimi - Researcher,其基座是自研新模型。文章对其进行大量实测,与 OpenAI 等对比,并探讨了 Deep Research 的重要性及 Kimi 的不足。

特工宇宙