产品测试」共找到 3196 篇相关文章

新闻资讯7

微软急了!紧急腰斩AI产品销售指标,内部拉响红色警告

微软AI市场遇冷,多个AI产品部门下调销售目标,如Azure AI等。原因一是自身产品未落地,体验差;二是过度依赖OpenAI、英伟达等伙伴。而谷歌势头正劲,抢占其份额。

量子位
新闻资讯7

AI看不懂的色盲测试背后,藏着一场像素与诗意的战争。

作者和同事测试AI色盲测试图,多模态模型Gemini 3 Pro、Claude Opus 4.5等纷纷答错,仅GPT 5.2 Thinking答对且靠代码作弊。研究发现,AI看图断章取义,缺乏人类的“格式塔”能力。

数字生命卡兹克
推荐文章7

传统PM假设已死!Anthropic的产品经理是怎么工作的?

文章指出在AI指数级增长时代,传统产品管理假设已不适用。以Anthropic的Claude Code为例,展示模型能力大幅提升,介绍了新的产品管理工作流程、四个根本性转变及新节奏,强调判断力的重要性。

AI工程化
推荐文章8

Anthropic Labs 负责人:AI 时代做产品,最大的陷阱是「做太多」

Anthropic Labs 负责人 Mike Krieger 在播客中探讨 AI 时代产品建造问题。他以重建 Bourbon 为例,指出 AI 加速开发有弊端,还分享产品易过度建设、需接受重写等观点,也谈到团队结构、企业客户矛盾等内容。

AGI Hunt
新闻资讯7

18 天做出来的产品,一个月留存 1%。OpenAI 抄袭 Skills?

2025下半年科技行业重速度,OpenAI开发Sora安卓应用仅18天,国内产品也纷纷发布。但快也有问题,Sora 30天用户留存率仅1%。此外,OpenAI人才策略激进,还被指抄袭。做产品应兼顾快慢。

MacTalk
开源动态7

视频推理界的“福尔摩斯测试”:所有大模型,统统不及格 | 论文代码开源

腾讯ARC Lab和香港城市大学推出Video - Holmes,这是视频推理界的‘福尔摩斯测试’,能展现多模态大模型复杂视频推理能力的边界,规避现有Benchmark痛点,测试中所有大模型全部不及格,代码已开源。

量子位
开源动态7

DeepSeek新模型DeepSeek-V4-Lite-285B测试曝光:“大海捞针”召回率100%

社区消息显示DeepSeek正测试新模型DeepSeek - V4 - Lite - 285B,用OpenAI MRCR 8 - pin标准考察超长上下文信息检索能力。测试结果优异,但‘大海捞针’法或被DSA作弊,实际效果存疑,社区高度关注其进展。

AI工程化
新闻资讯7

陶哲轩回应OpenAI新模型IMO夺金!GPT-5测试版也曝光了

OpenAI新模型在2025年IMO达金牌水平,GPT - 5也将发布。但陶哲轩指出缺乏统一测试标准,影响公平比较。MathArena测试中,Gemini 2.5 Pro仅13分,远低于铜牌线。

量子位
推荐文章7

当设计师和PM都开始写代码,产品构建方式又要变天了?

Notion 产品负责人 Max Schoening 与主持人探讨 AI 对软件构建和使用方式的影响。他认为成功产品有强大核心,鼓励设计师和 PM 用代码思考,还谈到岗位融合、可塑性软件、SaaS 趋势等话题。

InfoQ
新闻资讯7

807道灵魂拷问后,中国模型竟在「意义测试」中夺冠!

在美国新基准测试FAI - C中,中国开源模型Qwen3夺冠,DeepSeek的R1跻身前六,力压美国明星实验室顶级模型。该测试由前英特尔CEO帕特·基辛格所在公司Gloo推出,旨在让AI直面深层问题。

新智元