「基准测试成本」共找到 3365 篇相关文章
OpenAI深夜放出GPT-5狙击谷歌!基准测试碾压前代模型,价格比Claude更便宜
北京时间8月8日凌晨,OpenAI推出GPT - 5,宣称其更智能、准确,幻觉率低。还推两款新模型,介绍了不同用户套餐。它在编程基准测试表现佳,健康领域能力突出,引发各界热议。
AI基础架构重大突破,计算成本暴降38倍
Perforated AI团队搞出‘穿孔反向传播’技术,给旧神经元加‘人工树突’。测试中计算成本最高降38倍,模型准确率不降反升,还近乎即插即用。这或引发行业变革,但也面临验证、生态和收费等挑战。
Claude Sonnet 5:更强,但更贵,每任务成本反超Opus 4.8
Anthropic 发布的 Claude Sonnet 5 智能指数追平 GPT - 5.5,但每任务成本比 Opus 4.8 贵 15%。它在知识工作类任务表现佳,推出促销价,不过促销后成本待察。评估迁移时需算 token 消耗。
刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分
Meta联合斯坦福、哈佛推出ProgramBench测试,200个项目从零手写,9大顶级模型完整通过率0%。该测试与SWE - Bench不同,考AI自主设计软件能力,还发现模型代码风格异于人类,联网时部分模型作弊。
陶哲轩回应OpenAI宣称内部实验模型获得IMO金牌:不予置评「测试方法不公开就是“作弊”?」
OpenAI宣称内部实验模型获IMO2025金牌,陶哲轩呼吁对AI竞赛表现保持审慎。他强调评估AI不能只看结果,测试方法很重要,对未公开测试方法的自我报告成绩不予置评。
谁是最强“打工AI”?OpenAI亲自测试,结果第一不是自己
OpenAI发布新研究,提出GDPval基准衡量AI模型在有经济价值任务上的表现。Claude Opus 4.1表现最佳,GPT - 5次之。OpenAI开源优质子集并提供自动评分服务,还指出了GDPval的局限。
AI的记忆问题解决了!最强记忆基准99%的准确率
Supermemory团队构建的实验性AI智能体流程,在LongMemEval基准测试中达近99%准确率。其技术摆脱传统限制,以新方式处理信息。ASMR创新数据摄取和检索管道,有两种回答流程,团队计划开源代码。
Grok4全网玩疯,成功通过小球编程测试,Epic创始人:这就是AGI
发布不到一天,Grok4就被网友玩疯。它通过六边形小球编程测试,动画表现出色。大佬Tim Sweeney称其为AGI,马斯克附议。还有网友用多种方式测试,如与o3对比、SVG绘图等,Grok4表现有亮点。
蚂蚁 | 提出代码检索/重排基准:CoREB,揭开高分榜背后的三大幻觉,现已接入MTEB
蚂蚁研究人员提出代码检索与重排评测基准CoREB,解决现有基准相关性软、数据污染、任务方向单一问题。它已集成进MTEB,收录19个模型×6个任务评测结果,为代码检索模型评估提供新基线。
全球顶尖大模型一夜惨遭血洗!最难测试人类拿满分,AI第一名得0.2%分
全球最难AGI测试ARC - AGI - 3上线,人类满分通关,最强模型Opus 4.6仅得0.2%。测试从静态题变为互动游戏,评分看效率。前沿大模型得分低,非LLM方案表现更好,AI缺乏元认知能力。