代码评估数据集」共找到 4416 篇相关文章

新闻资讯8

GPT-5.2连肝7天,300万行代码造出Chrome级浏览器

Cursor的CEO让GPT - 5.2连续运行一周,产出300万行代码,从零构建Chrome级浏览器。还介绍不同模型长任务表现、多智能体协作架构,指出这将颠覆软件开发经济学。

新智元
开源动态8

71.2%的惊人解决率,伦敦大学开源顶级AI代码修复智能体系统

伦敦大学等发布Prometheus AI系统,它将代码库变成知识图谱,解决9种编程语言的GitHub问题。由五个智能体协作,解决率高、成本低且已开源,或为AI编程新方向。

AIGC开放社区
开源动态7

DeepSeek|从零构建轻量级vLLM:Nano-vLLM,吞吐量逼近原版,代码仅需1200行

开源的vLLM能提升LLM推理速度和资源利用率。近日,DeepSeek AI俞星凯从零构建轻量级Nano - vLLM,代码仅1200行。它有离线推理等功能,基准测试显示吞吐量逼近原版。

AINLPer
开源动态8

代码、多模态检索全面登顶SOTA!智源BGE向量模型三连击,并全面开放

检索增强技术在代码及多模态场景作用大,向量模型是关键。智源研究院联合高校研发三款向量模型BGE - Code - v1、BGE - VL - v1.5、BGE - VL - Screenshot,登顶多领域测试基准,已全面开放助力研究与应用。

机器之心
算法论文8

从Debugger到Developer : 低代码时代新基准NoCode-bench,SWE-Bench作者力荐

浙江大学牵头联合多机构推出全新评估基准NoCode - bench,直面自然语言驱动功能添加任务,发现当前最佳LLM成功率仅两成。它构建严谨,任务挑战大,指明AI软件开发改进方向,且已开源。

机器之心
新闻资讯7

Cursor一夜翻车,AI 300万代码写浏览器被打假!全网群嘲「AI泔水」

Cursor宣称GPT - 5.2连肝7天造出浏览器,但开发者发现其代码无法编译,是缺乏工程逻辑的“AI泔水”。这一行为激怒开发者,也揭示AI编程需明确分工,未来软件开发靠“开挂工程师”带领AI。

新智元
推荐文章8

Vibe Coding 方法论:不会编程的人如何用 AI 写出能跑的代码

文章介绍 Vibe Coding 方法论,即便不会编程,也能用 AI 写出能跑的代码。核心是把需求说清楚,还可小步迭代开发,Claude 这类会主动询问的工具更适用,同时要明确其适用场景。

宝玉AI
新闻资讯8

斯坦福宣布重磅AI战略重组:将HAI与数据科学合体,李飞飞升任校长顾问

斯坦福大学宣布将HAI与数据科学计划合并,新机构仍称HAI。李飞飞卸任联席院长,任校长AI特别顾问。新机构将围绕跨学科发现、教育变革、社会影响研究开展工作,强调开放原则并拓展国际合作。

DeepTech深科技
算法论文8

从需求分析到代码生成,LLM都能干点啥?一文读懂291个软工Benchmark!

大语言模型重塑软件工程各环节,但缺乏评估其在该领域表现的系统工具。浙江大学等机构团队首次对291个软件工程Benchmark系统综述,分析现状、痛点并给出改进方向。

新智元
开源动态8

让AI看懂科研图表:深势科技开源150万高质量科研图文数据

深势科技开源OmniScience数据集,含150万个高质量图文对。它利用先进工具攻克图文提取难题,经严格筛选成型,涵盖多学科。还设计重写流水线提升图文语义契合度,基于此训练的模型表现优异。

AIGC开放社区