「代码评估」共找到 2294 篇相关文章
AI 编程越来越厉害了,我要怎么提升自己的系统架构能力?
文章指出 AI 写代码能力提升,对程序员系统架构能力要求更高且难被替代。介绍系统设计概念,分析做系统设计的难点,给出新人提升系统设计能力的方法,还说明 AI 可辅助提升该能力。
太卷了!专属Coding的新一代Arena榜单来了,有国产模型登上榜首
大模型编程竞争激烈,编码能力提升成军备竞赛。LMArena发布新世代大模型编码评估系统Code Arena,国产模型智谱GLM - 4.6登上榜首,其编码能力获认可,彰显国产大模型硬核实力。
刚刚,Claude Sonnet 4.5重磅发布,编程新王降临!
北京时间今天凌晨,Anthropic发布Claude Sonnet 4.5,被定义为全球最强代码模型。它在多方面有显著突破,Anthropic还对全线产品更新,其在多项测试表现出色,且对齐性更好、更安全。
Agent能自己“复盘”和“进化”,这个开源框架牛了!
文章介绍了自进化AI,其核心是执行、评估、进化的反馈循环,能自动修改Prompt和工作流。还讲解了SEW、TextGrad等优化器原理,并以SEW为例展示逻辑,最后推荐开源框架EvoAgentX。
OpenAI与Anthropic罕见合作:竞争对手联手测试AI安全
OpenAI和Anthropic完成联合评估,用内部工具测对方模型并公开结果。测试覆盖指令层级、越狱等四大领域,还发现不少细节和道德困境情况。此次合作意义重大,为行业树立安全合作先例。
上下文工程比提示词工程好 10 倍,比 vibe 编码好 100 倍!Karpathy 站台,堪称「全新的氛围编码」。
Andrej Karpathy 提出「上下文工程」概念,Shopify CEO 更青睐它。研究显示开发者因 AI 幻觉和错误多,不信任其生成代码。上下文工程可成 AI 辅助开发核心技能,文中还介绍了相关开源项目及使用方法。
砍掉70%内存!陈丹琦团队破解LLM长文本瓶颈
大型语言模型处理长文本时,KV缓存占用内存巨大。陈丹琦团队提出KV足迹作评估标尺,推出分块驱逐与PruLong训练技术,在128K长文本任务中最高降低70%内存,性能损失仅10%。
【CUDA博客】关于TensorCore和Inline PTX Assembly的一个超简短笔记
文章围绕TensorCore和Inline PTX Assembly展开,介绍利用PTX指令发挥TensorCore潜力。讲述矩阵乘法和累加操作,给出半精度及替代浮点指令形式,有代码示例并分析,还提到不同数据类型用法及SASS指令。
重磅!微软宣布开源Copilot!Cursor:完了!
5月19日微软VS Code团队宣布完全开源其AI编辑器功能,将把GitHub Copilot Chat扩展代码以MIT许可开源并重构到VS Code核心。此决定受AI开发领域变化推动,在开发者社区引发争议。
Meta首个Agent生图模型登场,空降竞技场第二
Meta超智能实验室推出图像生成模型Muse Image,引入智能体机制,能编写代码、网络搜索,有自主修正能力,支持算力扩展、多轮编辑与画面合成。还预览了Muse Video,两模型均与Meta产品深度整合。