代码推理」共找到 3504 篇相关文章

开源动态8

Agent全自动搭建代码运行环境,实时更新解决评测过拟合/数据污染问题|微软

长期以来主流代码修复评测基准SWE - bench问题多,制约AI模型能力展现。微软发布SWE - bench - Live,引入新Issue,实现环境自动化构建与更新,打破传统局限,还揭示传统基准过拟合问题。

量子位
产品应用8

Harness Engineering:AI 能在真正"出事会炸"的后端系统里写代码吗?

文章围绕AI能否在后端系统写代码展开,以腾讯CDN LEGO项目为例,介绍了项目背景与挑战,通过nonstop项目探测AI编码能力,分析AI Coding易翻车的问题及根因,构建Harness Engineering架构并实践,最终效率提升20%。

腾讯技术工程
新闻资讯8

刚刚,OpenAI拿下IOI金牌,仅次于前五名人类选手!参赛推理模型才夺得IMO金牌

2025年国际信息学奥林匹克(IOI)中,OpenAI推理模型获金牌,在AI参赛者中排第一,得分仅落后5位人类选手。其未专门训练,成绩较去年大幅提升。此前它在IMO也获金牌级别成绩。

机器之心
开源动态8

Kimi K2 Thinking突袭!智能体&推理能力超GPT-5,网友:再次缩小开源闭源差距

Kimi K2 Thinking发布并开源,主打“模型即Agent”,能边思考边用工具,连续工具调用200 - 300次。在多评测基准超GPT - 5等闭源模型,代码权重遵循MIT协议,可在官网和应用实测。

量子位
算法论文8

首个测试时共进化合成框架TTCS:在「左右互搏」中突破推理瓶颈

厦门大学DeepLIT课题组提出全新测试时课程合成框架TTCS,不依赖外部标注,通过生成器与求解器共进化博弈合成课程数据,解决测试样本过难导致的训练坍塌问题,实验显示其推理能力提升显著。

机器之心
新闻资讯8

内存减6倍、精度0损失,推理提速8倍!谷歌新技术震撼了AI圈

Google Research团队推出TurboQuant技术,能将KV缓存6倍压缩、无精度损失,推理速度提升8倍,解决内存瓶颈问题,为大语言模型应用扫清障碍,引发业界关注,还致存储芯片巨头股价大跌。

AIGC开放社区
开源动态8

上海AI实验室造出首个「通才」机器人大脑:看懂世界+空间推理+精准操控全拿下

上海人工智能实验室联合多家单位提出通用具身智能大脑框架VeBrain,能集成视觉感知、空间推理和机器人控制能力。它统一三类任务语言建模范式,有“机器人适配器”,配套VeBrain - 600k数据集,性能测试表现出色。

量子位
新闻资讯8

刚刚,阿里发布最强推理模型Qwen3-2507,用疯狂一周暴击美国AI行动计划!

美国发布AI行动计划,欲成“世界AI冠军”,但阿里在7月22 - 25日三连发,推出Qwen3 - 235B非思考版本、Qwen3 - Coder、Qwen3 - 235B - A22B - Thinking - 2507推理模型,冲击美国计划。千问3在多领域表现出色,不过也有使用费用等小问题。

AGI Hunt
开源动态8

100美元、仅8000行代码,复现ChatGPT,Karpathy:这是我写过的最疯狂的项目

特斯拉前AI总监Andrej Karpathy发布全新开源项目「nanochat」,是极简且完整的「从零构建ChatGPT」训练框架。不到12小时GitHub星标破4.2k。约8000行代码,花100美元、4小时就能训练出专属「小ChatGPT」。

Founder Park
产品应用8

OpenAI官方揭秘:我们这样用Codex写代码「7大核心用法、6条最佳实践首次公开」

本文基于对OpenAI工程师访谈和内部数据,汇编了Codex的7大核心用法,如代码理解、重构与迁移等,还给出6条最佳实践,展示其如何助力团队高效工作、提升质量及管理复杂性。

AI寒武纪