「编程测试」共找到 2634 篇相关文章
「一只手有几根手指」,你的GPT-5答对了吗?
CMU博士生Tairan He测试发现GPT - 5答错‘一只手有几根手指’问题,指出语言难满足视觉与机器人领域需求,需VLM和VLA模型。编辑部测试发现顶尖大模型面对常识问题也会‘翻车’,还探讨了应对方法。
GPT-5.5反杀Claude登顶,AI编码旧榜不准了?
Datacurve推出新基准DeepSWE,号称「零污染」,用113道原创题挑战旧编程榜单。它使GPT和Claude名次逆转,揭示旧基准验证误差大、存在作弊现象,虽有局限,但反映编程基准竞争转向抗污染和验证可信。
Claude Opus 5刚发布就被玩疯了~
Claude Opus 5刚发布,社区就玩疯了。Anthropic给它定位接近Fable 5,价格仅一半。网友让它与Fable 5、GPT 5.6等做物理场景测试,Opus 5表现不错,但也有不足。官方还给出了其Prompt指南。
吴恩达来信:建立为人类服务的智能体社群
吴恩达讨论编程智能体分享经验平台的可能性,介绍了解决编程智能体获取最新API文档问题的chub工具。他提出收集智能体反馈以更新文档,还受Moltbook和Stack Overflow启发,认为智能体贡献反馈很有价值。
一年成爆款,狂斩 49.1k Star、200 万下载:Cline 不是开源 Cursor,却更胜一筹?!
AI编程助手市场看似火热,实则盈利艰难,如Cursor等工具亏本运营。Cline选择开源,坚持软件免费、服务变现,一年成爆款。其创始人分享了产品理念、技术选型、市场定位等,还探讨了MCP生态、编程智能体发展等话题。
死磕即梦48小时,我发现了AI公众号封面的懒人密码
作者与即梦Agent死磕48小时,分享AI公众号封面制作经验。介绍垫图法、两个提示词模板,测试提示词反推、语义理解等功能,指出不足,认为即梦像AI作图界拼多多,瑕不掩瑜。
Anthropic逼急奥特曼:自砍副业,死磕Claude主场
OpenAI最高层拉响「红色警报」,准备砍掉边缘项目,全面退守编程与企业市场主赛道。此前其「全面押注」策略导致资源内耗,而Anthropic专注企业和编程市场取得成功,Claude Code年化收入超25亿美元。OpenAI反击,Codex用户量提升。
烧了1万块横测,你用的模型可能掉队了
作者花大成本从后端、人味、前端、推理等维度,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。
DeepSeek识图模式全量上线,却认不出自家老板梁文锋
端午节前,DeepSeek全量推送识图模式。测试发现,它能认出黄仁勋,但忽略‘豆汁’字样,识别人物和潦草汉字准确率低,不过识别文物能力不错。还比较了与其他模型在乐理推理测试中的表现,开发者有新疑问待解答。
大模型IMO25数学竞赛成绩公布了
大模型挑战IMO 2025成绩出炉,Gemini 2.5 Pro以超30%总成绩断崖式领先,超出第二名89%。测试由MathArena组织,采用统一环境和双人匿名评估。还介绍了测试模型、题目及模型表现,人类版结果预计本周六发布。