编程测试」共找到 2635 篇相关文章

算法论文8

Meta提出数据筛选的理论:何时“少即是多”成立?

Meta针对机器学习领域‘少即是多’悖论提出理论框架,用高维统计等方法推导测试误差缩放定律,揭示数据筛选‘相变’条件,为实践提供指导,还重新定义‘数据效率’意义。

深度学习自然语言处理
算法论文8

北航LiveRepoReflection: 扭转乾坤-仓库级代码反射

本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。

PaperAgent
产品应用7

Claude Code 作者:别再沉迷功能堆砌了!最好的 AI 工具,是把控制权还给你

Claude Code 创造者 Boris Cherny 提出“极简主义哲学”,认为最好的 AI 工具应是简单、通用、无偏见的“乐高积木”,把控制权还给用户。还回顾编程发展,介绍开发体验进化及 Claude Code 工作流。

AI科技大本营
开源动态7

1.1K Star!告别单打独斗!让 AI 自己组建开发团队,自动分工、沟通、合并成果!

当前单个AI Agent编程有局限,遇到复杂项目力不从心。开源项目ClawTeam-OpenClaw是多智能体群智协作框架,让AI团队协作,解决了单个AI上下文窗口有限等问题,还具备自组织、工作区隔离等亮点。

开源星探
算法论文8

物理AI的「原生」时刻:原力灵机发布具身大模型DM0

主流‘预训练 - 后适配’范式有局限,原力灵机联合阶跃星辰提出具身原生 VLA 模型 DM0。它能统一机器人操作与导航,在 RoboChallenge 测试领先,还介绍了架构、训练方法及未来演进方向。

机器之心
新闻资讯8

OpenClaw之父爆猛料:Meta和OpenAI跪着抢人,小扎亲自求收购

OpenClaw之父Peter Steinberger做客播客,爆出Meta与OpenAI收购争夺内幕。他用一小时做出原型,打造出能自我修改源码的AI智能体,宣称AI智能体将消灭80%的App,编程会沦为「织毛衣」。

新智元
算法论文7

Google 新论文离谱到家了,0延迟0成本通用,提升大模型准确率最简单的方法。

Google新论文提出简单提升大模型准确率的方法,即重复提示词,把完全一致的输入连续发2次。主流模型适用,经70项benchmark测试,0场景效果倒退,47个场景准确率提升,且几乎不增延迟、成本。

探索AGI
算法论文8

清华、快手提出AttnRL:让大模型用「注意力」探索

清华和快手团队提出新框架AttnRL,引入注意力机制提升过程监督强化学习效率与性能。它解决传统方法在分支位置选择和采样策略上的效率问题,实验显示在多基准测试中表现优异。

机器之心
开源动态8

大模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单

蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。

量子位
推荐文章8

吴恩达深夜发文:GenAI 时代应用工程师的必备能力清单

吴恩达发文剖析GenAI应用工程师这一新兴职业。指出其技能要求与传统软件工程师不同,强调掌握多种AI积木块、利用AI辅助编程工具的重要性,还提及产品技能是加分项,并给出面试关键问题。

AGI Hunt