「代码验证」共找到 2385 篇相关文章
o1核心贡献者离职后首发声:AI是史上最强杠杆,超越人力、资本和代码
刚被曝加入Meta的前OpenAI核心研究员Hyung Won Chung,分享对AI未来的思考。他认为AI是最强大杠杆,能成个人能力倍增器,智能体开启无需许可的复合杠杆,还能推动人类科学进步。
OpenAI Codex 负责人:懂底层是没被淘汰的唯一底牌,顶尖工程师的终极归宿是“代码审查员”
OpenAI Codex 负责人 Michael Bolin 分享职业经历,从 Meta 底层架构工作到加入 OpenAI。他指出 AI 时代工程师角色转变,懂底层是不被淘汰的底牌,还给出提升能力的建议。
11.4K Star!基于 AI 大神 Karpathy 的编程经验开源的 Claude Code 技能插件。
AI写代码常遇盲目假设、过度设计、乱改代码等问题。开发者把AI大神Andrej Karpathy经验总结成Claude Code插件andrej - karpathy - skills,设定四大原则,还介绍使用、验证及自定义方法。
GPT-5.5反杀Claude登顶,AI编码旧榜不准了?
Datacurve推出新基准DeepSWE,号称「零污染」,用113道原创题挑战旧编程榜单。它使GPT和Claude名次逆转,揭示旧基准验证误差大、存在作弊现象,虽有局限,但反映编程基准竞争转向抗污染和验证可信。
AI接管程序员!Anthropic创始人自曝行业末日时间表
Anthropic创始人Dario Amodei预测,AI三到六个月内或能编写90%代码,一年后可能编写所有代码。谷歌超25%代码已由AI生成。不过人类短期内仍在代码设计等方面重要,程序员要适应与AI协作。
小模型也能精确计算:WorldModel-Qwen的推理时代码执行实验
开发者bigattichouse让Qwen - 0.6B小模型推理时生成并执行WASM代码获计算结果。最初尝试加标签生成Python代码效率低,后用WASM,创建三层架构。虽结果未完美,但接近,还通过Gemini审查验证。
终于用上啦,3.9 万 Star archify,程序员福音!!!!
架构图常与代码脱节,约3.9万Star的archify让Agent先把代码库或系统描述写成带类型的JSON,经布局、检查后交付可交互系统地图,它先结构化、验证再交付,适用于特定场景。
Andrej Karpathy:AI本质是「软件2.0」,并非电力或者工业革命
Andrej Karpathy分享AI影响经济的思考,认为应将AI视为“软件2.0”,提出预测AI自动化能力的“可验证性”指标,回顾软件1.0,阐述软件2.0,指出“可验证性”决定AI进展的“锯齿状”前沿。
CodeClash 通过多轮编程竞赛对大型语言模型进行基准测试
为评估大型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让多个 LLM 在多轮比赛中较量,涉及多种代码竞技场,还评估模型分析代码库能力,未来将处理更大代码库。
工程知识引擎:Harness Engineering体系下的工程知识底座
现代软件开发中,AI编程智能体虽能写代码但难理解代码,缺乏工程约束与上下文支撑。为此构建工程知识引擎,整合多维数据源,有向量检索等六大能力,经评估可提升智能体效率与代码质量。