「编程技能」共找到 1348 篇相关文章
我们离Coding领域的「AGI时刻」还有多远?字节跳动Seed发布NL2Repo-Bench仓库级长程代码生成基准
在AI编程领域,大家认为Coding领域的AGI似乎可以实现,然而真正的项目开发要求更高。近日,字节跳动Seed等联合发布首个评估编码智能体端到端仓库生成能力的基准测试NL2Repo - Bench,还介绍了其构建、评估等情况。
C3仓库AI代码门禁通用实践:基于Qwen3-Coder+RAG的代码评审
本文介绍C3仓库基于Qwen3 - Coder+RAG的代码评审实践,在CI流水线监听代码修改触发AI评审,可发现逻辑风险、拦截高危缺陷。该实践能提升评审效率与质量,可复用于代码门禁平台或辅助编程工具,当前仍在持续优化。
用AI写代码的真实体验:聪明却“不靠谱”的顾问,你敢用吗?
作者Luke Kanies曾是AI与LLM怀疑者,试用Vibe Coding后,认为要把AI当不太靠谱的外部顾问。用AI学Swift编程,发现它是糟糕架构师,但找语法错误快,相处中可让其做琐碎工作,不能全信它。
同一个模型,换套框架成绩差27%:SWE-bench分数到底谁说了算?
编程Agent评测是笔糊涂账,SWE - bench虽成事实标准,但分数不适合直接横向比较。基元律动等机构发布Claw - SWE - Bench基准,将模型、harness和任务集拆分,通过实验揭示harness对成绩影响大,还解决通用Agent评测问题,推出低成本Lite版。
英伟达揭示RL Scaling魔力!训练步数翻倍=推理能力质变,小模型突破推理极限
学界对强化学习能否让模型学会新推理技能争论已久,过去研究多悲观。英伟达研究指出,问题源于任务在基础模型训练数据中过度呈现及训练步数不足。其ProRL框架提升训练步数,释放小模型潜力,还构建技术组合拳。
硅谷天选之女,刷脸刷出3500亿独角兽!
外媒消息称,几乎0模型、0产品的Thinking Machines Lab欲融资40 - 50亿美元,估值达500亿美元。其创始人Mira Murati出身不凡,曾在OpenAI担任CTO。公司首个产品Tinker是应用程序编程接口。当下AI市场泡沫大,投资风向现分裂。
悬赏5000刀!148局AI斗蛐蛐世界杯官方战报出炉,全球赛邀你接棒来战
淘宝举办AI大模型斗蛐蛐世界杯,将12个顶尖模型放同一Agent框架,在12人局技能狼人杀场景对战150局。截至148局,谷歌两模型暂居前二,Qwen3-Max-2026-01-23排第三。还开启WhoisSpy国际赛,开发者可参与,前十有奖励。
Claude 小升级就赢了OpenAI 9年“开源神作”?高强度推理直接歇菜、幻觉率高达50%,写作还被Kimi 2吊锤?
OpenAI发布首个开源语言模型系列gpt - oss,包括gpt - oss - 120b和gpt - oss - 20b,可在Hugging Face下载。同期谷歌Deepmind推Genie 3,Anthropic放出Claude Opus 4.1。Claude Opus 4.1编程性能提升,实测编码能力强于gpt - oss。gpt - oss虽有亮点,但幻觉率高、实测效果不佳。