「Agentic软件测试」共找到 4514 篇相关文章
月之暗面硬刚Anthropic!开源万亿参数Kimi K2,Agent编码性能直逼闭源最强!
上周五月之暗面发布并开源万亿参数Kimi K2,外网评价高。它或开启开源AI的“Agentic时代”,在智能体和编码基准上表现出色,成本远低于竞品,但推理速度较慢,已可平替Claude。
从超级个体到超级团队:AI 如何重塑企业软件生产力?|2026 奇点智能产品大会专题前瞻
2026 奇点智能产品大会 7 月 17 - 18 日在北京举办,设「AI 驱动的软件生产力革命」专题,邀字节跳动、百度等团队实践者,探讨 AI 融入企业全价值链生产闭环,还准备了 AI 产品落地实战资料包。
智能体请求暴增9.4倍,token账单却没涨:Uber 公开AI软件工厂省钱方法
Uber 在 2026 年 AI 工程师大会分享软件工厂愿景。其 AI 工具嵌入开发各阶段,2 至 8 月智能体请求增 9.4 倍,成本稳定。介绍智能体会话四层、成本公式及优化手段,如选优模型、优化 token 等。
斯坦福英伟达推出测试时强化学习:微调开源模型胜过顶级闭源模型,仅需几百美元
斯坦福、英伟达等提出TTT - Discover方法,基于开源模型gpt - oss - 120b,在测试阶段引入强化学习更新模型权重。它采用熵目标函数和PUCT启发机制,解决分布外问题,成本低且表现优,但目前适用于连续奖励场景。
不吹不黑,GPT-5代码能力究竟怎么样?跟 Gemini 和 Claude 的对比测试给你答案
作者测试了 GPT-5 的代码能力,并与 Gemini 和 Claude 对比。在不同代码任务中,各模型表现不同。如在生成网页任务里,GPT-5 部分结果不错,但受 32K 上下文限制,长文本处理不如 Gemini,硬实力也不如 Claude。
AI泡沫后只剩这两类公司杀出重围!昆仑万维CEO方汉:明年唯一技术赛点在Agent
昆仑万维CEO方汉认为,AI泡沫是必经阶段,产品价值落地成主线,生态是系统工程。今年两类公司突围,四类公司落后。2026年技术赛点是Agent自动化‘可验证过程’。
学界大佬吵架金句不断,智谱和MiniMax太优秀被点名,Agent竟然能写GPU内核了?!
卡内基梅隆大学助理教授蒂姆·德特默斯与加州大学圣地亚哥分校助理教授丹·傅,就AGI是否会实现展开争论。他们还谈到算力、Agent应用等话题,看好小模型、开源模型等发展,认可中国大模型进步。
测试的同学要起飞啦, Cursor / Claude 党福音:一个 MCP 服务器把 Android 真机接进你的对话框
DroidMind是开源MCP服务器,将Android的ADB能力结构化暴露给支持MCP的AI客户端。适合调试、测试等场景,能让AI执行设备操作,有设备管理、调试信息获取等功能,使用体验友好且安全。
超越GPT-4o!华人团队新框架让Qwen跨领域推理提升10%,刷新12项基准测试
加拿大滑铁卢大学与TikTok新加坡的华人团队提出全新训练框架General - Reasoner,让Qwen系列大模型跨领域推理准确率提升近10%,在多项基准测试中超越GPT - 4o。该框架有全领域推理数据集和生成式答案验证器两大创新。
“我可能不再建议学计算机”!图灵奖得主炮轰半个行业,并断言:AI Agent最后全是数据库问题
图灵奖得主 Mike Stonebraker 在访谈中炮轰数据库行业,直言计算机科学未来或不再是增长型行业。他批判 Oracle、Google、AWS 等公司的数据库方案,还指出大模型写 SQL 在真实数据仓库中准确率极低,agentic AI 未来将成数据库问题。