产品应用7
国产AI大模型写作文能力飙升
开源AI项目落地
AI 摘要
开源AI:去年评测国产AI模型写高考作文问题多,今年再测进步巨大,能力指数级提升、文采惊人。通义千问和文心一言扣题出色,海外模型Grok跑题、Gemini写万字长文“翻车”。
阅读原文 · 开源AI项目落地
时隔一年,再次使用7个国产AI大模型写高考作文,国产模型的进步也太大了!有彩蛋。
去年评测国产模型写高考作文能力时,各模型问题不少,如用词重复、字数不足。今年再次测试7个国产模型,能力有指数级提升,文采惊人,扣题方面通义千问和文心一言表现出色。文末还有海外模型“翻车”彩蛋。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
SWE - Touch揭示Coding Agent共享协作能力缺口
当前基于大模型的Coding Agent是热门研究方向,现有评测多假设其独占代码仓库。中科院自动化所团队构建SWE - Touch框架,对9个前沿模型测试,发现用户干预下模型性能下降、排名洗牌。
深度学习自然语言处理
算法论文7
MLS - Bench评测:AI科研创新能力待提升
新工作MLS - Bench覆盖12领域、140个研究任务,评测前沿模型科研能力。虽模型工程执行强,但科学发现能力弱,当前仍难提出有效算法创新。其评测已纳入Kimi K3和Qwen3.8 - Max官方发版表。
新智元
开源动态8
腾讯 WorkBuddy 开源评测,曝光多模型底牌
腾讯 WorkBuddy 团队将内部模型选型评测等开源成 Benchmark,公开多模型 Agent 工作台选型底牌。Bench 优点是任务分布真实且开源可审计,论文介绍了核心方法论、四大赛道拆解、榜单结果,还对比了现有工作。
PaperAgent
产品应用8
Opus 5实测炸场,半价性能超Fable 5
Anthropic新模型Opus 5登场,多项评测中追平或反超Fable 5,价格仅为一半。网友实测表现出色,还具备硬核自检流程,性价比高。另外,Claude Code提示词删减八成,成绩未降。
量子位