基准榜单」共找到 1483 篇相关文章

算法论文8

32k微调处理百万Token:21倍的推理加速,10倍的峰值显存节省,实现恒定内存消耗

现有大模型处理超长文档易内存爆炸、计算崩溃。阿里巴巴未来生活实验室推出CoMeT架构,有双轨并行记忆系统,能恒定内存、线性时间处理文本,在基准测试超主流方法,实现21倍推理加速和10倍显存节省。

量子位
开源动态8

击败 GPT-5!理想汽车开源 RubricHub:大模型开放生成从此有了专业裁判

理想汽车基座模型团队联合高校发布RubricHub数据集,解决开放式任务评价难题。该数据集可将主观评价转化为量化标准,经其训练的Qwen3 - 14B小模型在医疗基准测试中超越GPT - 5。

AI科技评论
新闻资讯8

比肩OpenAI Simple Codex,中国团队闯入Terminal-Bench全球第二!

Anthropic和OpenAI推出新模型后,基础大模型较量进入实战比拼。中国团队Feeling AI的CodeBrain - 1在Terminal - Bench 2.0排全球第二,它聚焦代码编写运行,还能动态调整计划策略,展现出高含金量。

机器之心
开源动态8

智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析

智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。

AIGC开放社区
新闻资讯8

刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude

阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,可与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理性能,该模型已可免费体验。

InfoQ
开源动态8

用2D先验自动生成3D标注,自动驾驶、具身智能有福了丨IDEA团队开源

IDEA团队张磊团队提出OVSeg3R开集3D实例分割学习新范式。它无需人工后处理和3D掩码标注,降低训练成本,有望让3D实例分割商业落地,可用于自动驾驶、智能家居等领域。

量子位
算法论文8

142 TFLOPS 的差距:为什么在 Blackwell 上 FP4 MoE 算子工程至关重要

文章对三种主流MoE后端在Blackwell B200 GPU上做基准测试,发现SGLang与vLLM有142 TFLOPS差距,小batch时SGLang快1.84×。差异源于kernel融合、面向Blackwell的CUTLASS schedule及自适应grid sizing等优化。

GiantPandaLLM
新闻资讯7

3320亿市值,他们五年打造一家芯片龙头

沐曦股份发行价居年内科创板第二,网上发行中签率低,签浮盈刷新纪录成最赚钱新股。它2020年成立,由三位AMD前科学家创立,聚焦GPU研发,虽仍亏损但营收增速快,募资投向科技创新。

芯师爷
产品应用8

GPT-5.2 发布:做表格、写 PPT、敲代码 | 打工人的生产力利器

GPT - 5.2发布,在GDPval评测等众多基准测试中刷新行业水平。GPT - 5.2 Thinking适合真实场景与专业工作,在知识型任务、编码、长上下文处理、视觉理解、工具调用等方面表现出色,部分功能需付费使用。

AI进修生
算法论文8

视频模型也能推理,Sora2推理能力超过GPT-5

DeepWisdom团队研究发现视频生成模型能推理,在空间类任务上比图文模型更擅长。团队推出VR - Bench基准测试,构建客观评分体系。实验显示视频模型在空间推理有优势,相关代码和数据集已开源。

量子位