「产品测试」共找到 3203 篇相关文章
从性能到实战,怎样才算是靠谱的 Agent 产品?
红杉中国团队提出AI基准测试工具Xbench,其双轨测评体系不再单纯执着于测评问题难度,重点量化AI系统在真实场景的效用价值,还构建长青评估机制,以确保评估结果的时效性和相关性。
猹与猹发布丨好产品,值得被更多人看见!
猹与猹团队分享过去一年进展,先做AI产品大众点评「观猹」,举办黑客松活动,发布「TokenDance」。针对产品增长和内容创作痛点推出「猹与猹」,用OMG理论助AI团队,孵化优质内容。
HexStrike代理:让大模型继承专家经验,显著提升渗透测试效率
HexStrike是开源渗透测试工具,以MCP为底座。其核心智能组件IntelligentDecisionEngine是专家系统,将安全专家经验规则化,通过知识库和算法提供工具选择和参数优化,提升渗透测试效率。
测试时也能RL,英伟达等提出全新范式:TTT-Discover
近日,斯坦福、英伟达、Together AI 等联合开源全新测试时新范式 TTT - Discover,在测试阶段用强化学习微调模型,以刷出 single best 结果,用几百美元就刷新诸多领域 SOTA。
餐巾纸上的产品哲学:为什么NoteBookLM是AI圈的一股清流
文章介绍NoteBookLM,其设计师在餐巾纸上画原型。它用三栏结构解决用户痛点,克制不堆砌功能,不胡编乱造回答。其成功源于清醒的产品哲学,做减法创新,有定力拒绝诱惑。
Granola 为什么能赢:会议笔记,把产品做简单很重要
Granola是新推出一年多的AI笔记产品,迅速成硅谷创业者、投资人常用工具。其创始人认为,“AI笔记”头号竞争对手是苹果备忘录。产品好用关键在于极简“蜥蜴脑设计”与利用用户“上下文”,文中还分享设计思考与实用经验。
MetaGPT 用户智能体发布,开启端到端自主软件测试新范式!
当前AI软件领域代码生成智能化发展快,但测试验收仍靠手动,效率低。MetaGPT推出用户智能体,研究团队发布RealDevWorld框架和AppEvalPilot实现端到端自动化评测,解决复杂软件质量评估难题。
刚刚,GPT-5首次通过「哥德尔测试」!破解三大数学猜想
GPT - 5首次通过「哥德尔测试」,破解三大组合优化猜想。研究由海法大学和思科主导,团队设计五项测试任务,GPT - 5在三个简单问题上近乎完美,还推导出不同解法,标志AI从「学习数学」迈向「做数学」。
京东深夜开源,首个完整通用Agent产品,直指行业SOTA!
京东深夜开源业界首个“开箱即用”完整多智能体产品`JoyAgent-JDGenie`。与大多为SDK或框架的开源项目不同,它是端到端完整产品。在GAIA榜单表现佳,架构清晰且有技术创新,使用和二次开发简单。
Cursor也挖人了:Claude Code开发主管和产品经理被一锅端
编程神器Cursor母公司Anysphere挖到合作伙伴Anthropic两名前核心高管,原Claude Code开发负责人和产品经理将分别任Cursor首席架构师和产品负责人。这或使两家合作关系微妙,AI编程领域竞争激烈。