「代码能力」共找到 4456 篇相关文章
半年复盘,AI迎来预训练后的新瓶颈。
2025年上半年AI领域发展加速,编码和多模态能力提升。但模型在综合能力上遇到第二轮瓶颈,编码能力强时通用认知能力‘拉胯’,或与RL阶段使用编程数据有关,红杉新基准或推动模型均衡发展。
腾讯入局具身智能,宇树首批用上“大脑”
腾讯在WAIC 2025推出具身智能Tarios平台,它模块化提供能力,集成腾讯软件能力。腾讯重申“三不原则”,与众多厂商合作。该平台核心含模型算法与云服务,能为厂商补齐软件能力。
多模态大模型别盲目刷题!诊断-生成-强化闭环,找准盲点 | ICML'26
多模态大模型训练常采用‘题海战术’,存在能力诊断不精准、视觉内容缺乏扩展等问题。北大和山大团队提出DPE框架,通过‘诊断-生成-强化’闭环提升模型能力,实验效果显著,还强调训练应具备诊断能力。
AI分析师强得可怕
博主黄益贺称其AI分析师比多数人类分析师厉害。以分析ChatGPT Atlas为例,展示其深度思考、调研和分析能力。还介绍了用Claude Skills做的AI分析师能力包升级,提升了深度思考能力。
让GPT-4.1「头皮发麻的考试」!OpenAI给大模型上强度,AI能赢吗?
OpenAI 公布 MRCR 评测标准数据集,其针对 AI 模型上下文能力进行「奥运会」级别测评。MRCR 提升了测试难度,能揭示 AI 能力边界,推动模型发展,帮助更合理应用技术。GPT4.1 在一些测试中表现出色,未来 AI 能力上限充满可能。
豆包 Seed 2.0 来了:字节模型跨越鸿沟
春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。
我用Cursor测了下GPT-5.2,好像并不是那么回事儿~
GPT-5.2发布,奥特曼称其很强。作者用Cursor在真实Coding场景对GPT-5.2和Gemini 3 pro做测试,涉及烟花盛宴、5000篇Paper分析、RAG代码重构,结果显示GPT-5.2在多方面表现欠佳,写代码需慎重。
Claude 代码框架之战
开发者尝试让Claude做繁琐编码工作,自己担任高价值角色。当前开发者社区正进行“Claude代码框架之战”,文中给出设计Claude工作流的八个选择及搭配套餐,指出设定框架能让AI发挥最大效力。
Prompt、Skills、MCP:大模型上下文工程核心链路
文章聚焦大模型上下文工程,介绍了Prompt、Skills、MCP核心链路。Prompt是与模型沟通基础,但其有脆弱、难管等痛点,促使向上下文工程演进;Skills是能力单元,可显式化能力、动态组合;MCP解决能力集成问题,虽有争议但理念重要。
Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化模型长程任务能力是关键
Anthropic 两位研究员在采访中表示 2025 年强化学习在大语言模型训练奏效,如 Opus 4 能处理长周期任务。还探讨模型发展方向,如用户与多模型交互、模型可解释性等,认为未来会有白领 AI 员工。