「北极星指标」共找到 290 篇相关文章
AI进化时间表已现!LLM每7个月能力翻倍,2030年职场不复存在?
LLM正飞速进化,METR研究发现其智能每7个月翻番。到2030年,一个模型几小时就能完成人类工程师数月的工作。该研究提出“任务完成时间视野”指标衡量模型能力,不同模型表现差异大。
醒醒吧!CEO猛吹AI写95%代码,绩效考核却还在拼程序员手速?
本文是对 Superhuman 工程负责人 Loic Houssier 的深度访谈。他分享了 AI 时代团队管理、开发流程、绩效评估等方面的变化,指出 AI 虽提升效率,但在质量评估、人才适配等方面仍需探索,还强调观望 AI 发展会有职业风险。
Grok 4刷新ARC-AGI-2纪录:15.9%碾压所有公开模型,我们离AGI还有多远?
xAI的Grok 4在ARC-AGI-2测试中获15.9%,成全球最强公开AI模型。ARC Prize主席还原测试过程,虽成绩亮眼,但网友有质疑,且离人类表现差距大。Grok 4在多基准测试领先,定价便宜。
知识类型视角切入,全面评测图像编辑模型推理能力:所有模型在「程序性推理」方面表现不佳
东南大学等团队提出KRIS - Bench,从知识类型视角对图像编辑模型推理能力评测。它分三大知识范畴、细化多种任务,设四维度评估指标,测10款模型,发现模型程序性推理等能力不足。
微信自研高性能推理计算引擎 XNet-DNN:跨平台 GPU 部署大语言模型及优化实践
本文深入解析微信自研的高性能推理计算引擎 XNet-DNN,介绍其核心技术架构和性能优化策略。该引擎基于 RCI 框架构建跨平台 GPU LLM 推理能力,在多方面超越现有解决方案,还给出了详实对比实验数据。
LLM省钱大测评!48块GH200,首个百亿级参数量实证
EfficientLLM项目聚焦LLM效率,提出三轴分类法和六大指标,实验覆盖多方面。研究表明效率优化需权衡,最优策略因任务和模型规模而异,且相关技术可迁移到跨模态模型,成果将开源。
VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
PDL 在 SGLang Kimi K3 中的应用
文章介绍 PDL 在 SGLang Kimi K3 中的应用,K3 内核优化接入 PDL 以缩短相邻内核间隙。分析 PDL 原理、在 bs=1 decode 中解决的问题,阐述计算链和通信链上的应用,还提及性能数据和实现问题。
Agent 形态一天一个样,Infra 到底该为谁而建?
过去一年,Agent 应用形态多变,但进入稳定生产环境的项目有限。清程极智师天麾认为,Agent Infra 重要性待显,当前应提高 Token 生产交付效率。还探讨了 Agent 发展问题、Token 相关指标及收费模式等。
「压缩,就是你所需要的全部」!菲尔兹奖得主Michael Freedman新作揭开数学真相
菲尔兹奖得主Michael Freedman认为人类真正创造和关心的数学本质是「柔软且可塑」的。他在最新论文提出「压缩,就是你所需要的全部」,并在采访中探讨人类数学直觉与机器逻辑的鸿沟,认为理解压缩机制是人类与AI在数学领域协作的起点。