「Coding 基准测试」共找到 2876 篇相关文章
突发!OpenAI「掀桌」:自研推理芯片「墨西哥辣椒」跑赢英伟达
OpenAI公布自研推理芯片Jalapeño(墨西哥辣椒)测试结果,它专为大语言模型推理设计,能同时提升吞吐量和降低延迟,在多模型测试中超NVIDIA系统。该芯片与Cerebras合作,计划2026年底部署。
o4-mini暴击六大数学天团,攻破陶哲轩难题!4.5h激战人类阵地失守
Epoch AI团队举办竞赛,约40位数学精英分成8组与o4 - mini - medium在FrontierMath基准上对决。o4 - mini击败6组团队,虽未完全超越人类,但Epoch AI预测到2025年底AI可能超30% - 50%人类基准。
豆包要收费了:三档订阅最贵500元/月,保留免费基础版
五一假期时,豆包要收费的消息冲上热搜。苹果App Store已现订阅服务声明,分三档,最贵500元/月,目前仅测试,正式上线会发完整信息,且保留免费版。豆包APP日活、用户新增和规模都断层领先。
月烧35万元token、逼得Claude官方连夜限速!被全网吐槽的中国“榜一大哥”,已经靠 AI 年入千万了
X用户“刘小排”认领30天按200美元计划消耗5万美元Claude Code token一事。他靠AI年入近千万,用Claude Code做产品,回应网友质疑,称在规则内使用,还分享创业经验,认为AI是长期机会。
国产AI高考708分,这款模型靠什么成为「屏蔽生」?
高考放榜,媒体对国内外大模型进行测试。综合成绩上,讯飞星火X2物理、历史类表现优异;单科专项中,它在数学、作文等测试也领先。其优势源于数据积累、理解评判标准,还采取软硬件一体化落地路径。
Base44 现在每天增 40 万美金 ARR,华人团队做了一个 AI 学习相机很有意思
被 Wix 收购的 AI Coding 产品 Base44 发展迅猛,每天新增约 40 万美金 ARR。同时,行业对 AI Coding 产品利润存质疑,a16z 反驳后又遭 Cline 批判。此外,还提到华人团队做的 AI 学习相机有创新点。
The Batch: 944 | Llama 之后的时代
Meta发布首个AI模型Muse Spark,是多模态推理模型,在部分健康和多模态测试领先,编程与智能体任务有不足。Meta披露技术细节少,该模型基准测试有竞争力,但其从开放转向封闭引开发者担忧。
姚顺雨署名:大模型「现学现卖」能力首次被系统评估,腾讯、复旦联手发布CL-Bench
腾讯混元团队和复旦大学研究人员联手推出全新基准测试CL - Bench,系统性评估大模型上下文学习能力。测试显示十大前沿模型表现不佳,揭示当前大模型在该能力上的普遍短板,并指出未来四个探索方向。
多 AI 协同 + SDD 编程实践:一个 AI 全流程交付实录
2025 年以来 AI Coding 技术发展迅速,但在复杂业务场景中存在诸多问题。文章基于 SDD 范式,构建由 Claude Code、CodeX 与 Gemini 协同驱动的工作流,介绍 SDD 理念、技术选型,详述多模型协作机制、工作流程与保障机制,分享实践步骤。
本地LLM万字救场指南来了!全网超全AI实测:4卡狂飙70B大模型
文章围绕本地大语言模型(LLM)展开,针对实用性和经济性问题,用Dell Precision 7960塔式工作站对主流模型测试。涉及不同尺寸模型、推理框架等,给出不同配置下性能指标及使用建议,还模拟真实场景测试。