「Agentic软件测试」共找到 4518 篇相关文章
王云鹤眼中的Harness:复杂优化问题,AGI灵魂争夺之战
王云鹤在知乎文章中探讨Harness Engineering,指出Agent=Model+Harness,多模型配合能提升Agent能力。还分析Harness存在的必要性,认为它是复杂优化问题,关乎AI“灵魂”之争。
刚刚开源就斩获 2.7K Star!吴恩达老师开源了一个 AI 员工 OpenWorker!
吴恩达老师开源了桌面 AI Agent OpenWorker,对标闭源 Agent。它能交付成品,本地优先、支持多模型,重要动作需审批。有 25+ 连接器,支持定时任务和角色模板,提供多方式上手。
最新研究!大模型“角色扮演”无效了?
沃顿商学院研究测试6个主流AI模型,进行超25000次测试,发现告诉AI扮演专家角色,不会让其回答更准确,反向设定‘低知识’角色有时表现更好,角色扮演不是提高准确性的万能钥匙。
全球首个历史基准!普林复旦打造AI历史助手,AI破圈人文学科
普林斯顿大学AI实验室与复旦大学历史学系联手推出全球首个历史领域评测基准HistBench及AI助手HistAgent。HistBench含414道题,能检验AI深度认知能力;HistAgent集成多种工具,在测试中表现优异。
杜克大学、Zoom推出LiveMCP‑101:GPT‑5表现最佳但未破60%,闭源模型Token效率对数规律引关注
杜克大学与Zoom研究者推出LiveMCP - 101,这是针对真实动态环境的MCP - enabled Agent评测基准。含101个任务,实验显示先进模型成功率低于60%,研究为提升Agent能力提供改进方向。
为什么 2025 的基模公司都押注 Interleaved Thinking?
本文探讨 2025 年基模公司押注 Interleaved Thinking 的原因。从大模型迭代说起,介绍其在多模型中的体现,阐述该思维链对 Agent 的重要性,还提及 MiniMax 在推动其成行业标准上的诸多努力及带来的影响。
当亚马逊云科技拿到“麦克”,一年的云计算叙事都被改写了
2025亚马逊云科技re:Invent大会上,CEO Matt Garman围绕Agentic AI落地发布系列新品。其认为落地需四大支柱,亚马逊云科技带来如芯片、模型等成果,还强调私有数据及开发者工具重要性,多个企业已实践应用。
华为推出软工代码智能体SWE-Lego,解锁SFT训练极致性能
华为研究团队推出仅基于监督微调(SFT)的软件工程代码智能体SWE-Lego,无需复杂RL流程,在SWE-bench Verified基准中表现出色,项目已开源。它有数据、训练和测试时扩展三大创新。
字节做了个 AI 手机,钉钉做了台 AI 主机
2025 年末 AI 硬件圈热闹非凡,月初豆包 AI 手机上线刷屏,后因平台风控引发讨论。近日,钉钉发布 AI 主机 DingTalk Real,定位 AI Agent 执行载体,还推出 AgentOS 统一调度,已跑通多企业场景。
刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude
阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,可与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理性能,该模型已可免费体验。