产品测试」共找到 3214 篇相关文章

开源动态8

你的AI“体检”了吗?开源AI红队测试平台,一键自查三大风险

AI圈一边是顶尖模型发布,一边是大模型被“越狱”输出有害内容。腾讯朱雀实验室开源A.I.G平台,能模拟真实攻击对AI产品全方位风险扫描,有大模型体检、基础设施漏洞扫描、MCP Server风险检测三大核心能力。

腾讯技术工程
开源动态8

打破AI能力的惯性评估方式,红杉中国推出全新双轨基准测试xbench|甲子光年

红杉中国推出全新AI基准测试工具xbench,采用双轨评估体系,构建多维度测评数据集,追踪模型理论能力上限与Agent实际落地价值。还采用长青评估机制,首期发布两个核心评估集并给出综合排名,公开后邀各界完善。

甲子光年
7

从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!

90后华裔女高管Cat Wu推动Anthropic产品“按天迭代”,她认为token成本低于工程师工资。她分享了产品发布、团队协作等经验,还谈到AI时代PM应具备的能力,以及Claude系列产品的使用和发展方向。

InfoQ
算法论文7

1/3预算跑平 GPT-5?上海AI Lab「路由魔法」成本直降63%性能反涨 7%!

当前大模型需解决性能与效率平衡问题,GPT - 5用测试时路由技术初步平衡。Avengers - Pro测试时路由框架集成不同LLMs,通过嵌入、聚类、评分操作,调整权衡参数α,能依查询特征选模型,性能和效率优于单一模型。

CourseAI
推荐文章7

AI Agent 的工程化被低估了

文章指出 AI 发展中工程化作用被低估,将其分为产品工程和技术工程拆解构建 AI Agent 体系。产品工程涵盖需求建模、UI/UX 设计等模块;技术工程涉及架构模块化、流量控制等方面,还提及 Spring AI Alibaba 等工具。

阿里云开发者
新闻资讯7

顶尖技术+标准产品+创新模式+可靠服务,打造大模型商业落地中国范式 | 卓世科技@MEET2026

在大模型参数竞赛白热化的当下,焦点转向模型如何在行业存活、产生价值。卓世科技合伙人赵策在MEET2026大会提出,大模型下一场竞争在模型、终端、数据与业务流闭环,该司据此在多领域落地应用。

量子位
新闻资讯7

故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究

OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。

量子位
新闻资讯7

刷屏的SBTI,底层算法有点东西…

近期SBTI人格测试爆火,它出自B站UP主Q肉儿串儿,初衷是劝朋友戒酒。经分析,它大概率是“人工主导+AI辅助”的产物,技术架构简单,算法逻辑是答题拆维度、分数归档、模板匹配。此外,还有大神网友推出MBAI版测试题。

量子位
新闻资讯8

陶哲轩亲测!GPT-5 Pro 40分钟破解3年难题,登顶最难数学考试

数学家陶哲轩将几何难题交给GPT - 5 Pro,虽推理完美但无解。同一周,GPT - 5 Pro在FrontierMath测试集夺冠。陶哲轩测试发现AI在科研不同层面表现有别,也揭示了AI理解力受限及人类与AI的分工边界。

新智元
新闻资讯7

7个AI玩狼人杀,GPT-5获断崖式MVP,Kimi手段激进

OpenAI总裁转发基准测试,让7个LLMs玩210场狼人杀。GPT - 5胜率96.7%断崖式领先,国产Qwen3和Kimi - K2分列第4、6。测试方分析模型性格,还借此研究LLMs社会行为,长远目标是实现AI驱动的市场研究。

量子位