产品应用7
实测:Kimi K2“吊打”阿里Qwen-3 Coder
探索AGI
AI 摘要
作者实测:在真实项目中,Kimi K2任务成功率93%,Qwen - 3 Coder仅47%。Kimi K2指令遵循、Bug修复等表现更好,成本低3.3倍,作者更推荐Kimi K2用于代码开发。
阅读原文 · 探索AGI
我花12小时深度实测,阿里Qwen-3 Coder被Kimi K2“吊打”!
作者花12小时在真实项目中实测阿里Qwen - 3 Coder和Kimi K2。结果显示,Kimi K2在任务成功率、指令遵循、Bug修复、代码重构等方面全面领先,成本还更低,作者更推荐Kimi K2用于代码开发。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
Opus 5通关测试:强模型需简单环境
ARC Prize官方给Opus 5的ARC - AGI - 3成绩为30.2%,但开发者Jeremy Berman让其借助电脑,正确率飙升至96.2%。还开源代码,换用Codex等测试效果差。表明模型强时,简单环境更佳。
新智元
新闻资讯7
三款LLM新品发布,社区实测性能大比拼
LLM大爆发,一天内推出Grok 4.6、Qwen3.8 - Max、DeepSeek - V4 - Pro - 0813三款前沿产品。社区对它们进行多场景测试,如3D场景、Flappy游戏、飞机滑行动画等,并对比了不同模型的性能、价格和输出质量。
PaperAgent
推荐文章7
烧钱评测:国模格局或改写
作者花大成本从后端、人味、前端、推理等维度,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。
探索AGI
产品应用7
GLM - 5.2测试表现出色,比肩闭源旗舰
作者对GLM - 5.2、Opus 4.8和GPT 5.5进行两项测试。一是审计Skill体系,GLM - 5.2覆盖skill数多、找出冲突多,还挖出bug;二是做世界杯夺冠推演器网站,Opus表现出色,GLM - 5.2省token,Codex有巧思但结构有缺陷。
AI产品黄叔