Coding 基准测试」共找到 2875 篇相关文章

新闻资讯7

担心蒸馏问题,Meta限用Claude Code、Codex

据外媒报道,Meta限制员工在AI模型构建中用Claude Code和Codex,因担心涉及模型蒸馏,且随着AI使用成本上升,Meta想让更多开发工作迁至MetaCode,这揭开了AI Coding时代新问题。

机器之心
产品应用7

CAI+DeepSeek渗透测试情况及扩展分析

文章对CAI+DeepSeek进行渗透测试。介绍CAI安装,在kali按Ubuntu指令装,使用界面友好。测试中CAI执行指令彻底灵活,扫描分析到位。还提及CAI多种能力,称其作为开源框架全面细致,值得研究。

AI与安全
产品应用8

借助 AI Coding 快速打造 AI Agent 系统

文章围绕购物场景生成AI Agent系统展开,原有低代码方案遇瓶颈,团队转向LangGraph等工程方案,借助AI Coding工具重构上线。介绍了项目需求、挑战,阐述核心架构升级,分享AI Coding开发实践及项目成果与启示。

阿里云开发者
产品应用7

分享10个你可能不知道的Claude Code隐藏命令。

作者分享10个Claude Code隐藏命令,如/btw可并行提问不污染上下文,/rewind能分别回退代码和对话等,还介绍快捷键,强调Claude Code更新快,建议关注更新动态。

数字生命卡兹克
新闻资讯7

Mythos逼谷歌再拉红色警报!布林连夜成立Coding突击队

Claude Mythos来势汹汹,谷歌拉响红色警报,布林和CTO成立Coding特攻队。团队重点提升模型复杂编程任务表现,还将内部代码纳入训练数据,且推动员工用编程工具。

量子位
新闻资讯7

ClockBench:一个简单的钟表测试让AI全线溃败

ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。

AI工程化
算法论文8

一篇92页大模型Vibe Coding技术全面综述

中科院计算所&杜克大学发布首篇Vide Coding技术全面综述。介绍以“氛围/结果”为导向的Vibe Coding开发范式,含技术分类、能力分析、开发模式、数据模型等内容,还提及价值及反馈回路等。

PaperAgent
产品应用8

Claude Code 首席工程师揭秘 AI 如何重塑开发日常!

近日,Anthropic发布Claude Code首席工程师Boris与对外沟通负责人Alex的对话,揭秘Claude Code诞生、能力、技巧与展望。它可在终端辅助编程,适配多环境,还集成Claude Max套餐,新模型让其功能更强大。

AI科技大本营
产品应用7

通过逆向工程探秘 Claude Code 背后的运作机制

作者通过逆向工程研究Claude Code内部运作,了解其比Cursor等工具慢且贵的原因。Claude Code注重通用性和安全性,执行任务时多有安全检查,虽增加成本延迟,但更可靠,且在命令行工具中用户体验出色。

宝玉AI
推荐文章8

造过 Codex 的人,为什么每天用 Claude Code

Calvin曾带队构建编程Agent Codex,如今日常用Claude Code。他和Garry Tan在播客聊了编程Agent的产品哲学差异、分发逻辑等。Claude Code拆分上下文表现出色,LLM成开发者工具推荐引擎,还探讨了构建、使用编程Agent的要点。

宝玉AI