编码性能」共找到 2241 篇相关文章

新闻资讯7

性能到实战,怎样才算是靠谱的 Agent 产品?

红杉中国团队提出AI基准测试工具Xbench,其双轨测评体系不再单纯执着于测评问题难度,重点量化AI系统在真实场景的效用价值,还构建长青评估机制,以确保评估结果的时效性和相关性。

机器之心
新闻资讯7

GPT-5.5反杀Claude登顶,AI编码旧榜不准了?

Datacurve推出新基准DeepSWE,号称「零污染」,用113道原创题挑战旧编程榜单。它使GPT和Claude名次逆转,揭示旧基准验证误差大、存在作弊现象,虽有局限,但反映编程基准竞争转向抗污染和验证可信。

新智元
产品应用3

Claude Code 桌面版烂爆了,Anthropic 终于把 “100% AI 编码”演砸了

Anthropic将Claude Code做成桌面应用,本值得期待,然而新桌面版却问题频出,如卡顿、崩溃、自动化功能不稳定等,还出现大量基础功能问题。此前Anthropic宣称代码由AI编写比例高,但产品质量堪忧。

InfoQ
开源动态8

华为推出软工代码智能体SWE-Lego,解锁SFT训练极致性能

华为研究团队推出仅基于监督微调(SFT)的软件工程代码智能体SWE-Lego,无需复杂RL流程,在SWE-bench Verified基准中表现出色,项目已开源。它有数据、训练和测试时扩展三大创新。

机器之心
算法论文8

Meta超级智能实验室又发论文,模型混一混,性能直接SOTA

大语言模型训练依赖算力和时间,传统模型 Souping 多采用均匀平均。Meta 等研究者提出类专家 Soup(SoCE),利用基准测试类别构成选最优模型,非均匀加权平均,实验显示其提升了模型效果与稳健性,在排行榜获 SOTA 成绩。

机器之心
开源动态7

让NCCL性能起飞的symmetric memory是啥黑科技?— part2

本文是NCCL 2.27新特性系列的第二部分,主要分析symmetric primitives的实现机制,介绍其提供的接口,如获得symmetric ptr、barrier、send、recv、llEpoch控制等接口,还解析了底层结构内存布局、各接口工作机制及LL Buffer划分机制等。

GiantPandaLLM
推荐文章7

多智能体自主规划模式性能提升:五大精准策略详解

本文基于多智能体React模式实践,剖析自主规划架构挑战,如工具调用延迟等。提出五大优化策略,像用流式XML替代FunctionCall、合理压缩上下文等,还介绍创意加速器AI绘画创作功能,为多智能体规划模式提供借鉴。

阿里云开发者
新闻资讯7

新的 Rust 客户端致力于实现基于 Aerospike 的安全、高性能应用

Aerospike正式发布Rust客户端,用于与其实时NoSQL数据库交互。采用异步优先并发模型,支持批命令等。还将支持分区查询等功能,Aerospike也提供其他客户端库助开发者构建应用。

InfoQ
推荐文章7

性能最高提升7倍?探究大语言模型推理之缓存优化

文章探讨大语言模型推理缓存优化技术演进与未来展望,介绍了主流推理框架vLLM、SGLang,分析KV Cache、Paged Attention、Prefix Caching等技术的优化点,还提及LMCache、DeepSeek的缓存技术,最后提到MCP赋能可视化OLAP智能体应用。

阿里云开发者
产品应用8

DeepSeek睁开眼了!Opus-4.8的性能,1000张图不到20美分

DeepSeek首个多模态视觉模型deepseek-v4-flash-vision-exp上线DeepSeek API平台。文本能力与V4-Flash持平,多模态Agent能力逼近Opus-4.8,分析1000张图成本不到20美分,还上线免费Files API。

AIGC开放社区