「Coding测试」共找到 2548 篇相关文章
「一只手有几根手指」,你的GPT-5答对了吗?
CMU博士生Tairan He测试发现GPT - 5答错‘一只手有几根手指’问题,指出语言难满足视觉与机器人领域需求,需VLM和VLA模型。编辑部测试发现顶尖大模型面对常识问题也会‘翻车’,还探讨了应对方法。
网易云音乐前 CTO 曹偲:代码越来越不重要,好的架构才是软件工程核心
网易云音乐前CTO曹偲推出AI Coding产品Toco AI,旨在将确定性和工程性带入AI Coding。他认为架构决定软件开发上下限,代码会逐渐黑盒化,业务架构更重要且难被AI取代,产品可助力软件开发。
Cursor已死,Claude当立!Anthropic用L4级Agent,正在“降维打击”整个AI编程赛道。
AI编程领域正上演变革,很多用户从Cursor转向Claude Code。Claude Code成本有优势且具L4级编程能力,其强大还冲击了生态。未来Agentic DevOps是黄金赛道,最终赢家或为有顶尖模型与云服务的玩家。
Claude Opus 5刚发布就被玩疯了~
Claude Opus 5刚发布,社区就玩疯了。Anthropic给它定位接近Fable 5,价格仅一半。网友让它与Fable 5、GPT 5.6等做物理场景测试,Opus 5表现不错,但也有不足。官方还给出了其Prompt指南。
蚂蚁C2LLM:基于注意力池化的代码检索新范式
在Code RAG场景中,传统文本Embedding模型处理代码表现欠佳。蚂蚁集团与上海交通大学联合发布C2LLM系列模型,引入注意池化模块,在MTEB - Code榜单表现出色,还得益于优质训练流程,成果已回馈社区。
AIGCode宿文:我就是要自训练大模型,直接做「L5」| AI产品十人谈
AIGCode宿文坚信Coding是培育大模型的最佳场景,公司自训练66B基础模型,发布锡月大模型,开启AutoCoder内测。宿文认为AI Coding能解决代码供给问题,目标是实现AGI,虽面临诸多质疑,但他坚持直接做L5。
死磕即梦48小时,我发现了AI公众号封面的懒人密码
作者与即梦Agent死磕48小时,分享AI公众号封面制作经验。介绍垫图法、两个提示词模板,测试提示词反推、语义理解等功能,指出不足,认为即梦像AI作图界拼多多,瑕不掩瑜。
Reddit 上爆出大猛料,Claude 为何封号中国用户又快又准?
Reddit大佬逆向Claude Code 2.1.196版本,发现Anthropic为防中国用户,早在2.1.91版本就装监控程序。它用隐写手段标记并回传用户信息,代码也经加密混淆。Claude Code负责人称是防滥用实验,将回滚检测逻辑。
设计师的 ChatGPT 时刻:Figma 这次把“设计即代码”玩成现实
文章介绍了AI编程产品分类,指出Vibe Coding存在的问题。重点讲述Figma在2025 Config发布Vibe Coding产品Figma Make,其可从设计稿生成网页,有编辑工具精准迭代等功能,还推出可视化低代码建设工具Figma Site。
烧了1万块横测,你用的模型可能掉队了
作者花大成本从后端、人味、前端、推理等维度,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。