「任务性能」共找到 3534 篇相关文章
TileLang vs Triton 详解:谁该握住控制面——编译器还是开发者?
文章对比 TileLang 与 Triton 两个框架,解释控制面设计、并发协议、编译管线的本质差异,以及这些差异如何影响性能上限、工程投入。明确 TileLang 追求榨干内核,性能上限高但对开发者要求高;Triton 追求快速落地,生态成熟。
英伟达全新开源模型:三倍吞吐、单卡可跑,还拿下推理SOTA
英伟达推出专为复杂推理和agnet任务打造的开源模型Llama Nemotron Super v1.5,实现SOTA表现,吞吐量提至前代3倍,可单卡高效运行。它采用NAS优化架构,经多数据集训练,现已开源。
蚂蚁 | 提出代码检索/重排基准:CoREB,揭开高分榜背后的三大幻觉,现已接入MTEB
蚂蚁研究人员提出代码检索与重排评测基准CoREB,解决现有基准相关性软、数据污染、任务方向单一问题。它已集成进MTEB,收录19个模型×6个任务评测结果,为代码检索模型评估提供新基线。
小米MiMo Agent 跨会话进化
多数AI编程Agent任务一长就忘事,业界主流靠堆上下文窗口应对,但有缺陷。小米MiMo团队开源的MiMo Code,靠显式存储 - 检索机制,200步以上任务胜率超Claude Code达65%,介绍了其设计及优缺点。
LeCun新作反杀AGI派!AI连「鸟」都搞不懂,拿什么超越人类?
图灵奖得主Yann LeCun联手斯坦福团队最新论文揭示,LLM仅在粗糙分类任务表现优秀,精细任务却失灵。研究测试30多个大模型,得出三大发现,指出LLM与人类在概念形成和信息处理上存在本质差异。
刚刚,微软全新一代自研AI芯片Maia 200问世
微软原定于 2025 年发布的下一代 AI 芯片 Maia 200 问世。它基于台积电 3 纳米工艺,性能强、能效高,是异构 AI 基础设施重要部分,将为多个大模型提供支持,已部署在美国中部数据中心区域。
The Batch: 929 | Qwen3.5 超越更大模型,领跑视觉基准测试
阿里巴巴发布 Qwen3.5 系列,含 8 个开源权重的视觉 - 语言模型。其小模型表现超大体量 OpenAI 开源权重模型,在视觉任务中整体出色,部分在语言任务也有竞争力。虽团队有人员离职,但阿里承诺加大 AI 投入。
字节全球首发AI技能商店:一句话生成Coze Skills,你的经验直接卖钱
在全球AI共识下,Agent Skill成新战场。字节扣子此次升级,推出Skill、长期任务,还全球首上线技能商店。Coze Skill可封装经验,长期任务能拆解目标,技能商店能让经验变现。此外还推出视频Agent SKill。
斯坦福、英伟达和伯克利提出具身Test-Time Scaling Law
斯坦福、英伟达和伯克利团队提出具身Test - Time Scaling Law。研究发现推理时增加计算量可提升VLA模型性能,揭示动作误差与采样数量幂律关系,还探讨关键问题,给出方法,实验证明结合RoboMonkey能显著提升性能。
人大和微软开源Arbor,一棵假设树突破自主科研新高度
中国人民大学和微软研究者推出Arbor,它将实验挂到假设树,让研究信息跨周期保留。在六道真实研究任务中表现优异,增益超Codex和Claude Code,且成本相当,还能从失败中积累经验。