代码修复评测」共找到 2321 篇相关文章

推荐文章7

“Skills 不就是脚本套个壳吗?我十几年前就玩 AutoIt 了”

程序员常认为 Agent Skills 是脚本换壳,实则二者有本质差异。脚本按步执行,Skills 由 AI Agent 调度、用自然语言编排工作流。确定的事用代码,不确定的交给 Agent。Skills 降低成本、利于分享,进化快但有安全问题。

宝玉AI
产品应用7

GLM4.5实测:审美不如R1,全栈还不大可用,别急冲

7月29日智谱开源GLM - 4.5。作者实测发现其在UI设计审美不如R1,生成卡片表现不一,Coding能力勉强及格,全栈代码生成未达可用阈值,存在无多模态能力、上下文窗口短等问题,目前还别急着冲。

AI产品黄叔
新闻资讯7

Replit 怒锤“欧洲版 Cursor”:造出百款“高危”应用,普通开发者一小时内黑入,氛围编码成了黑客“天堂”?

近日,Replit 员工报告 Lovable 未修复关键安全漏洞,扫描发现其百款应用高危,普通开发者一小时内可黑入。Lovable 虽推出‘安全扫描’功能,但仍未解决底层问题,引发对氛围编码安全责任的讨论。

InfoQ
产品应用7

Cursor Origin 上线,GitHub 的老玩法还够用吗?

8月17日,GitHub服务异常,同日Cursor向付费计划开放Origin early beta。代码仓库接入更多Agent,现有设施适应人的节奏,而Agent工作节奏更快。Origin重写协作成本,与GitHub设计前提有差异,马斯克布局延伸到软件生产链。

AI科技评论
产品应用8

打通AI4S数据入口:MinerU.Chem让化学文献中的“图片”,从“人类可读”走向“AI可用”

上海人工智能实验室 OpenDataLab 团队发布 MinerU.Chem 技术报告及成果,升级化学文献智能解析能力。它能将化学文献图片转化为 AI 可用数据,解决化学知识机器难用问题,在评测中领先,还将助力 AI4S 发展。

OpenMMLab
算法论文8

王梦迪、丛乐团队Science Earth:当组织本身开始涌现,全球科学能力第一次在同一张网上互相发现

王梦迪、丛乐团队在arXiv发布预印本论文,推出面向AI原生科学发现的行星级操作系统Science Earth,它能连接全球科学能力。文中通过两个案例展示其作用,并介绍协调内核EACN,还公开了论文、代码与网络。

量子位
开源动态7

20刀月费秒变API!Hermes一行命令就能用上Claude、ChatGPT订阅

两大开源Agent框架有硬核更新。Hermes Agent v0.14用一行命令把模型订阅变API,零成本驱动开发工具,还接入Grok。OpenClaw 5.18修复问题,适配Grok。20美元月费可喂饱工具链,打破生态闭环。

新智元
开源动态8

拒绝传统 Router“瞎指挥”,多智能体如何实现智能任务分配?

企业级多智能体系统瓶颈常是负责分发任务的传统 Router 太“傻”,搞不定跨域、解不了冲突、跟不上变化。腾讯云开源 TCAR 智能路由模型,它先推理再选 Agent 集合,经多数据集评测表现出色,还提供完整开源范式。

InfoQ
推荐文章7

TileLang深入详解-第三章-Kernel,Buffer,并行控制和矢量化

文章详细介绍TileLang核心编程构造,包括Kernel函数、Buffer和并行控制等。阐述其计算定义、并行与循环控制方式,还提及性能优化的矢量化访存,给出代码示例,并分享源码里形状、并行域和线程的最佳实践。

GiantPandaLLM
算法论文8

Arc研究所造出能“举一反三”的虚拟细胞模型,破解跨细胞预测难题

生物学和药物研发中,因细胞组合庞大,难以全实验验证,且同药在不同细胞效果不同。Arc Institute 团队推出虚拟细胞模型 STATE 及评测套件 Cell - Eval,STATE 预测效果优,但也存在短板。

DeepTech深科技