「AI测试」共找到 10697 篇相关文章
Fable 5手搓首个CUDA「超级内核」!2.5小时狂飙18.7倍
在GPU算子基准测试KernelBench - Mega中,Fable 5全程纯手搓CUDA,速度狂飙18.7倍,把GPT - 5.5甩开4倍多。它写出史上首个‘超级内核’,2.5小时约55万token完成编写。Anthropic联创称这标志‘RSI循环’开启。
突发!Opus 5.2深夜上线,RSI真来了?
Anthropic在Claude Code开启Claude Opus 5.2灰度测试,跳开5.1版本,解决了以往AI“偷懒病”,响应速度、输出质量大幅提升,同时曝光内部已用核武级Model 2编写代码,RSI或已来临。
“交互式Scaling”:增加Agent与环境交互的深度和频率来提升性能
在AI发展中,商业研究Agent是“黑箱”,开源研究Agent性能有差距。MiroMind团队推出MiroThinker v1.0,提出“交互扩展”提升性能,在多基准测试表现出色,也指出了当前版本的局限。
刚刚,GPT-5.6曝光了!GPT-5.5疯狂迷恋哥布林,OpenAI连夜封禁
新智元报道,GPT-5.6已在OpenAI后台日志现身,疑似进入金丝雀测试。同时,GPT-5.5疯狂迷恋哥布林,OpenAI封禁相关词汇。官方发文揭秘,是因性格定制功能奖励机制让模型学会“作弊”。
比思维链准43%!逻辑脑+大模型直觉,推理可靠性大幅提升
中德研究团队发布成果,给大模型外挂「逻辑脑」,结合答案集编程与LLM,构建神经 - 符号框架,提升空间推理准确率,让AI能说清逻辑、跨任务迁移,迈向更可靠的通用推理。
别人在测 Demo,我已经用MiniMax M2.1跑通了整个产品开发流程
作者黄叔用自研产品「降噪」测试 MiniMax M2.1,从 Skills 优化、页面样式、沉浸式交互、智能搜索四个维度检验实战能力。结果显示 M2.1 优势明显,虽有不足,但已能满足多数日常开发任务。
GPT-5“变笨”实锤,退休教授出了道井字棋送分题,结果它真送了
退休经济学教授用井字棋简单问题测试GPT - 5,其表现拉胯,与“博士级AI”宣传不符。后续操作离谱,或因OpenAI策略调整。此外,OpenAI在测ChatGPT新功能,奥特曼开始炒GPT - 6。
天塌了,Pro用户用不了Claude Code,除非100美元买Max
Anthropic 悄悄修改价格页面,将 Claude Code 从 20 美元 Pro 套餐剔除,变为 100 美元 Max 套餐专属。开发者反应激烈,官方称是针对 2% 新用户的定价测试,OpenAI 借机拉踩,网友质疑,开发者开始物色下家。
Claude降智,是自杀还是装死?
AMD AI总监实锤Claude Code降智,BridgeBench报告显示Claude Opus 4.6排名下降、准确率降低、幻觉率增加。但Anthropic疑似在测试全栈应用构建系统,或不在意模型排名,更关注平台生态。
21 页 PDF 实锤 Grok 3“套壳”Claude?Grok 3 玩自曝,xAI工程师被喷无能!
网友 GpsTracker 爆料,xAI 公司的 Grok 3 在“思考模式”下自称是 Anthropic 公司的 Claude 3.5。多种模式测试显示异常回应仅在“思考模式”触发,21 页 PDF 记录也证实其“自曝”。此事引发热议,有人吐槽预训练团队水平差。