代码修复评测」共找到 2319 篇相关文章

新闻资讯7

DeepSeek“极你太美”bug,官方回应了

DeepSeek V3.1调用API开发时输出常现“极”字,在火山引擎、腾讯CodeBuddy等多平台出现,影响代码编译。官方称将在近版本修复,网友猜测或因数据清洗不彻底。

量子位
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码

PaperAgent
开源动态8

节前重磅:开源旗舰模型新SOTA,智谱GLM-4.6问世

国庆前智谱AI发布新一代旗舰模型GLM-4.6并将开源,它在多方面提升,如编码、上下文长度等,评测性能佳,token消耗降低。经实测,其代码、研究、开发等能力强,成全球开源AI领域重要力量。

机器之心
产品应用7

大厂代码库几百万行,Claude Code怎么跑起来的?Anthropic首次公开全套打法

Anthropic发布文章总结Claude Code在企业规模部署的最佳实践。Claude Code导航类似软件工程师,与RAG驱动工具不同。其harness由多扩展点组成,在部署中有三种常见配置模式,还给出应用建议。

AI寒武纪
新闻资讯7

cursor翻车了,Anthropic:来,我教你怎么做long running Agent。

近期,Cursor宣称用大量智能体实现长程任务引发关注,但被指是营销惨案,代码存在诸多问题。Anthropic则分享务实的long - running思路,是记忆接力模式,代码可维护。未来模型能力提升或让代码成黑箱。

探索AGI
算法论文8

303页年度最佳AI Code综述:阿里、字节、快手30家顶级机构出品

分享303页《从代码基础模型到智能体与应用:代码智能实践指南》,由近30家顶尖机构出品。介绍2021 - 2025年代码大型语言模型发展,分析通用与代码专用LLM能力,阐明研究 - 实践差距,还开展实验。

PaperAgent
产品应用7

教程 | 如何做出 X 上爆火的 AI 蓝图动画

作者受X上爆火的Midjourney风格代码启发,分享恐龙主题短片制作方法。介绍风格代码功能,还讲了控制画面配色技巧,最后给出复杂动画prompt示例,推荐找风格代码的作者和网站。

量子位
推荐文章7

所谓“氛围编程”,不过是“技术债”的新马甲

本文编译自 Steve Krouse 演讲与博客,指出‘氛围编程’代码即遗留代码、‘技术债’,编程核心是理论构建。还认为工具优于智能体,代码是描述软件的正确媒介,人类大脑在编程中始终是核心。

AI科技大本营
推荐文章7

氛围编程行不通!CTO们集体炮轰AI编程:不是失业,而是失控

CTO们认为氛围编程是灾难,如代码上线后出现系统崩溃、用户权限漏洞等问题。Augment Code的Chris Kelly演讲指出,AI写代码有局限,软件工程师要做决策,还给出写让AI接手代码的建议。

InfoQ
新闻资讯7

说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。

作者有感于AI在真实工作场景评测的稀缺性,以阿里国际站RealReplicaBench评测集为例,介绍电商场景任务,发现多数模型成功率低,其他领域类似,呼吁厂商努力,作者也计划自跑评测更新排名。

数字生命卡兹克