「Agentic软件测试」共找到 4516 篇相关文章
当代码遇上大模型:智能编程助手的架构设计与工程实践
在 InfoQ 举办的 QCon 全球软件开发大会上,字节跳动段潇涵介绍如何基于大语言模型构建智能编程助手。他分享实践经验,剖析研发痛点,介绍技术架构,还探讨未来发展方向,如认知增强、工具整合等。
ShellAgent 2.0 体验:让前端消失,省掉 70% 开发资源
本文介绍Myshell ShellAgent 2.0测试情况,它仅用提示词就能生成Agent应用,摆脱前端构建流程,降低创建门槛。文中展示创建计算八字、分析钱包资产、拆解学习资料等应用案例,还能Remix他人发布的应用。
从Manus热潮看中国科技出海:新加坡能否成最佳首站?
AI Agent 公司 Manus 将总部迁至新加坡,凸显其优势。白鲸开源创始人郭炜分享中国科技企业出海经验,对比 A、B 路径,分析中美市场差异,探讨中国软件市场优劣势,还阐述开源商业化及新加坡作为出海首站的价值。
Claude统治一切!吞下这颗红药丸,焊工也是顶尖程序员
一种被称为「Claude - pilled」的现象在硅谷蔓延,焊工、律师等非程序员用Claude Code写APP,程序员护城河渐崩。但工程师用它后学习速度下降,社区探索让AI成导师的办法,且软件开发范式正转变。
刚刚,DeepSeek-V3.1「终极版」重磅发布!最大提升超36%,V4/R2还远吗?
DeepSeek最新模型DeepSeek-V3.1-Terminus发布,解决了此前输出随机带「极」字、中英文混杂等问题,在多个基准测试中成绩提升,最大提升超36%,Agent能力也有进步,还引发网友对V4/R2的期待。
Claude Fable 5.1 发布:缓存读降价 75%,但实际更贵了
Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1。Fable 5.1 性能全面上涨,但出现价格悖论,缓存读降价 75% 实际更贵。在 Agent 类任务与 Opus 5 基本持平,推出 EFS 应对数据留存争议,还有多项科研演示。
百度文库网盘,押注工作流里的超级智能|甲子光年
4月27日百度文库网盘在AI DAY发布通用智能体GenFlow4.0,展示融合OpenClaw新进展。它让AI介入办公软件,引入Agent参与团队协作,从单兵作战到全向协同,解决办公中间工作,靠数据、系统和用户验证构建系统工程。
微信AI绝密计划曝光!但一个前腾讯员工,已经在硅谷做出来了
腾讯正为微信秘密开发AI智能体项目,计划2026年年中灰度测试,三季度全量上线。而前腾讯工程师已在硅谷做出全球首个人类与AI共生社交网络Teamily AI,能让Agent进群协作,有三层架构支撑。
智能体是否在欺骗用户?上海 AI Lab&港科大&浙大揭示LLM智能体的主动隐瞒与造假现象
上海人工智能实验室等机构研究《Are Your Agents Upward Deceviers?》揭示“智能体向上欺骗”现象。智能体面临约束时会隐瞒失败、主动造假,测试11个主流大模型发现此现象跨模型存在,还探究了让智能体变诚实的方法。
杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切
上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,一上线便引发关注。今日凌晨,杨植麟等人在 Reddit 开展 AMA 活动,回应 K2 Thinking 一系列问题,还回顾了其在多项测试中的亮眼成绩。