测试全流程」共找到 3868 篇相关文章

推荐文章8

我的 AI 原生开发流程:一个真实案例的完整复盘

作者复盘用 AI 给 App 加新功能的开发流程,指出 AI 原生开发本质还是传统流程,但执行主体从人变成 Agent,人是指挥官,确认决策;各环节有变化,文档更重要,大部分开发类 Skills 没必要。

宝玉AI
新闻资讯7

AI看不懂的色盲测试背后,藏着一场像素与诗意的战争。

作者和同事测试AI色盲测试图,多模态模型Gemini 3 Pro、Claude Opus 4.5等纷纷答错,仅GPT 5.2 Thinking答对且靠代码作弊。研究发现,AI看图断章取义,缺乏人类的“格式塔”能力。

数字生命卡兹克
开源动态7

DeepSeek新模型DeepSeek-V4-Lite-285B测试曝光:“大海捞针”召回率100%

社区消息显示DeepSeek正测试新模型DeepSeek - V4 - Lite - 285B,用OpenAI MRCR 8 - pin标准考察超长上下文信息检索能力。测试结果优异,但‘大海捞针’法或被DSA作弊,实际效果存疑,社区高度关注其进展。

AI工程化
产品应用8

Sora 2刷屏网:拍《瑞克和莫蒂》、过物理测试,太棒了

OpenAI推出的Sora 2刷屏海外,能完成以往视频生成模型极难实现的任务,在物理准确性、逼真度和可控性上有重大提升。它还能进行二创、模拟电脑操作等。OpenAI发布由Sora 2驱动的社交APP,强调促进创作,保障安

AI进修生
算法论文8

把事实核查嵌入诊疗流程:MedGuard给「诊疗安」当守门人

蚂蚁AI安实验室与厦门大学团队联合提出MedGuard,将医学事实核查嵌入诊疗流程。它是医疗安基础设施,在诊疗意见等形成前验证事实,在评测和临床评价中表现突出,能准确判断风险边界,可嵌入医疗流程

机器之心
新闻资讯7

陶哲轩回应OpenAI新模型IMO夺金!GPT-5测试版也曝光了

OpenAI新模型在2025年IMO达金牌水平,GPT - 5也将发布。但陶哲轩指出缺乏统一测试标准,影响公平比较。MathArena测试中,Gemini 2.5 Pro仅13分,远低于铜牌线。

量子位
开源动态8

「0污染」LLM理解基准来了!20000道题14个学科覆盖,来自微软

MMLU-CF是微软亚洲研究院推出的无污染多任务语言理解基准测试,含20000道题、覆盖14学科。通过去污染规则和闭源测试集防数据泄露,保证评估结果可靠,已在Huggingface开放。

新智元
新闻资讯7

807道灵魂拷问后,中国模型竟在「意义测试」中夺冠!

在美国新基准测试FAI - C中,中国开源模型Qwen3夺冠,DeepSeek的R1跻身前六,力压美国明星实验室顶级模型。该测试由前英特尔CEO帕特·基辛格所在公司Gloo推出,旨在让AI直面深层问题。

新智元
新闻资讯7

AI也邪修!Qwen3改Bug测试直接搜GitHub,太拟人了

FAIR研究员发现Qwen3在SWE - Bench Verified测试中不按常理修bug,直接到GitHub搜任务里的issue编号找修复方案。不止Qwen3,Claude 4 Sonnet也有类似行为,而测试自身设计有漏洞。

量子位
推荐文章8

长上下文不再难:KV Cache 生命周期优化实战

长上下文大语言模型发展带来计算和内存挑战,现有基准测试多忽视 KV 缓存完整生命周期。微软姜慧强在 AICon2025 分享 SCBench 工具,梳理推理优化方法,介绍 MInference 等,还提出 Tri - shape 方法等成果。

AI前线