性能评测」共找到 2468 篇相关文章

算法论文8

ICLR 2026 oral | AI代码真能进生产环境?SwingArena:从「写对代码Commit」到「通过CI审查」

过去一年大模型写代码能力提升,人们思考其能否参与软件工程核心流程。现有评测基准有缺失,SwingArena填补空白,将博弈引入评测,设计检索增强流水线,其开源后或成评估AI编程能力新工具。

机器之心
推荐文章7

关于Pingpong和Cooperative的一些感性理解

作者团队在SGLang支持Hopper架构相关GEMM,经分析发现多数场景Pingpong调度策略性能优于Cooperative,K维度小的场景DeepGEMM性能优于CUTLASS。本文重点介绍Pingpong性能优势及Cooperative无法Overlap Epilogue的原因。

GiantPandaLLM
算法论文8

ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案

多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。

机器之心
开源动态7

开启Benchmark的Harness时代:15家学术机构联合发布HarnessEval

8月13日,DeepSeek开源Agent Harness dsh引发行业对“Harness”的关注。近日,MirroS联合多机构发布HarnessEval,将其概念引入评测系统。它使评测从Metric到Harness,形成可执行评测系统,已落地于交互式世界模型。

机器之心
算法论文8

Auto-Research「终极大考」:新基准撕下大模型科研伪装

来自多所高校的研究者提出MLS - Bench,用于解决现有Auto - Research评测的归因问题。它含140个真实研究任务,校准受控修改范围,主实验显示当前模型在方法发现上有明显缺口,Auto - Research需更严格评测标准。

机器之心
开源动态8

腾讯混元AI Infra核心技术重磅开源:推理吞吐提升30%!

腾讯混元AI Infra团队开源生产级高性能LLM推理核心算子库HPC-Ops,基于生产环境痛点开发,降低底层算子开发门槛,实现显著性能突破。在真实场景下,混元、DeepSeek模型推理QPM提升,单算子性能也超越主流算子库。

腾讯技术工程
推荐文章8

Anthropic:这样构建Agent,性能提升90%!

Anthropic分享从0到1构建多智能体DeepResearch系统的方法,该系统是Claude内置Research功能。干货多,涵盖架构设计、Prompt工程等。多智能体性能比单模型高90.2%,但烧钱,适合高价值复杂任务。

探索AGI
算法论文8

推理时扰动高熵词,增强LLM性能

香港科技大学(广州)研究团队发现LLM推理时,一小部分高熵词显著影响输出正确性。基于此提出MTI方法,含Selective CFG intervention与Lightweight negative - prompt guidance,无需额外训练,能提升模型推理能力。

机器之心
新闻资讯7

Cloudflare 构建了面向 LLM 的高性能基础设施

Cloudflare发布全新基础设施,可在全球边缘网络运行大型AI大语言模型。它将模型输入处理与输出生成拆分,自研Infire推理引擎,还推出Unweight模型压缩系统,分享提示词缓存优化方案。

InfoQ
新闻资讯7

Claude最新模型Mythos意外泄露,性能远超Opus

Anthropic内容管理系统配置失误,近3000个未发布资产泄露,Claude最新模型Mythos提前公开。它在软件编码、学术推理和网络安全等测试中远超Opus,网络安全能力尤其危险。2026年初Anthropic产品密集发布。

开源AI项目落地