「Agentic软件测试」共找到 4569 篇相关文章
阿里开源DeepResearch模型,超强“AI研究员”,开启自主智能体新纪元
阿里巴巴通义实验室开源Tongyi DeepResearch模型,是全球首个性能能与OpenAI DeepResearch较量且全开源的Web Agent。它采用先进架构,有两套推理范式,训练方法论有创新,实测表现佳,应用场景广,用Apache - 2.0许可证。
阿里云 CIO 蒋林泉:AI 大模型时代,我们如何用 RIDE 实现 RaaS 的首次落地?
阿里云 CIO 蒋林泉分享大模型落地实践,指出 AI 是时代“大电梯”,企业需迅速搭乘。介绍阿里云数字人多场景应用成果,提出 RIDE 方法论助企业落地,还剖析翻译与 Agent 模式要点及 E2E 落地关键。
开源大模型实战:GPT-OSS本地部署与全面测评
2025年8月5日,OpenAI发布GPT-OSS-120B和GPT-OSS-20B开放轻量级语言模型,采用Apache 2.0开源许可证。文章介绍通过Ollama本地部署GPT-OSS -20B模型的方法,并对其进行AI幻觉、算法、SQL、数学题等测试。
清华&通院推出"绝对零"训练法,零外部数据大模型自我博弈解锁推理能力
清华、北通院和宾州州立大学研究人员提出“绝对零”训练法,让大模型通过自我博弈生成并解决任务获推理能力。测试显示,其训练出的模型超专家标注样本训练的模型,且能提升编程与数学推理表现。
Karpathy的编程经验Skills,开源了,Star涨疯了。
周末,Karpathy大佬的编程经验开源skills项目火了,它把其吐槽大模型写代码的问题编译成大模型可理解的约束。安装简单,还列举了一些规则示例。如今行业把人的经验编译成Agent可执行格式,开源范式改变。
AI 原生软件工程的可观测性与可控制性
文章指出 AI 成研发主力军,改变软件生产方式,传统研发管理办法需升级。当前人和 AI 协作有诸多问题,介绍了研发三阶段,阐述可观测性与可控制性概念、关键指标,以及实现可控制性的要素,强调二者结合构建高效研发体系。
一夜暴涨至2100亿!开源新王MiniMax M2.5,革了Opus 4.6的命
新智元报道,国产AI春节档,MiniMax M2.5昨夜登场,今日市值涨至2108亿港元。其编码性能逼平Claude Opus 4.6,价格仅为1/20,适配开发者工具,在办公、深度研究等场景表现出色,基于Agent RL技术体系。
顶级邪修再战 Nano Banana Pro ,超多玩法,太猛了这玩意!
谷歌发布 Nano Banana Pro 模型,将图片模型能力推向顶峰,支持中文。它能生成准确视觉内容、多语言文本,可混合多元素,支持多分辨率。经测试,其各方面表现出色,应用场景丰富,版权限制宽松,三方应用和谷歌官方均可使用。
2.4万亿参数原生全模态,文心5.0一手实测来了
文心5.0正式发布,主打原生全模态,支持全模态输入和输出。官方测试显示其多维度表现突出,在LMArena文本排行榜并列全球第二。实测其理解精细、能捕捉细节,技术上采用自回归统一结构和超大规模混合专家架构。
DeepSeek-V3.1震撼发布,全球开源编程登顶!R1/V3首度合体,训练量暴增10倍
DeepSeek正式上线DeepSeek-V3.1,作为首款「混合推理」模型,将开启智能体新时代。它参数共671B,具强大智能体能力,编程击败Claude 4,训练量大幅扩增,在多方面测试表现出色,稳坐编程开源第一王座。