「Agentic软件测试」共找到 4509 篇相关文章
94.5K Star!2026现象级开源 AI Agent,Moltbot(原Clawdbot)+飞书保姆级安装教程!
2026年现象级开源Agent工具Clawdbot改名Moltbot,获94.5K Star。它能接管本地设备,可通过飞书交互。文章给出Moltbot搭建教程,包括准备工作、部署步骤和接入飞书机器人方法。
智谱AutoGLM上线:给每个手机都装上通用Agent,AI从"对话"走向"操作"的里程碑
智谱AI上线AutoGLM,这是全球首个手机通用Agent,能让AI操作手机完成复杂任务。其技术架构强大,在多方面表现优异,与其他AI助手相比优势明显,还推出情感语音模型GLM - 4 - Voice,正推动大模型落地AI手机。
北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师
北大与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估大模型在动态交互中可靠性的问题。测试显示,顶尖大模型成功率最高仅40%,不同模型还暴露多种问题。
人类最后考试登上Nature:全球50个国家近千名顶尖学者打造的AI测试集
人类最后的考试(HLE)登上Nature,这一测试集由全球50个国家近千名顶尖学者打造,含2500道高难度试题。现有的人工智能评估工具已跟不上技术演进,HLE能测出AI极限,让顶尖机器暴露短板。
GPT-6 Astra突袭:正面对垒 Fable 5.1,多项编码测试反超!OpenAI 总裁:欢迎来到 AGI 时代
今天凌晨,OpenAI 发布 GPT-6 Astra,公司称是多年研究成果。它在多项测试表现出色,编程、电脑操作等能力提升,还加强了安全措施。将面向部分用户及通过 API 和 AWS 推出。
一步步实战 CopilotKit(AG-UI协议):快速集成前端UI与后端Agent的神器【上】
文章介绍AG - UI协议及CopilotKit,前者为前端UI与后端Agent集成标准,后者是其参考实现。结合实例展示CopilotKit能力,包括前后端State共享、调用前端“工具”等,还给出构建演示Demo的详细步骤。
谷歌深夜放出 IMO 金牌模型,多项测试力压 Grok 4、OpenAI o3!网友评论两极分化
8月1日晚谷歌向Ultra订阅用户推Deep Think功能,Gemini 2.5 Deep Think模型在IMO夺冠。它是多智能体模型,能并行处理问题。多项测试中表现优于Grok 4、o3,不过网友评价不一。
你的 AI 助理一闭嘴就在「发呆」?上交大 ProAct:把 Agent 的空闲时间变成生产力
上海交通大学 APEX 实验室提出 ProAct 架构,能把对话空闲时间转化为主动准备机会。它有预测、筛选、交付三级流水线,经 ProActEval 评测效果佳,证明算力用对地方更重要,让 Agent 能提前为用户准备。
谷歌深夜放出 IMO 金牌模型,多项测试力压 Grok 4、OpenAI o3!网友评论两极分化
昨夜谷歌向 Google AI Ultra 订阅用户推 Deep Think 功能,Gemini 2.5 Deep Think 模型获 IMO 金牌。它是多智能体模型,通过并行思维输出答案,在多领域及测试中表现佳,但网友评价不一。
Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra,吞吐最高提升 3 倍
大语言模型走向“完成任务”,Agentic RL 后训练让系统工作负载不稳定。港中文和恒生大学团队提出 Libra 资源管理系统,统一优化训练与 rollout,在多任务中提升吞吐,论文与代码已公开。