「基准构建」共找到 2651 篇相关文章
硅基大脑记忆觉醒!会遗忘、会反思、会成长的AI正在到来
哈尔滨工业大学等机构团队发表研究,用认知神经科学视角审视AI记忆系统,探讨如何让AI产生“自我”,构建会遗忘、反思、成长的记忆大脑,还涉及记忆分类、存储、管理、评估、防御及未来演进等内容。
告别「手搓Prompt」,前美团高管创业,要让物理世界直接成为AI提示词
在2025年AI硬件赛道火热背景下,Looki创始人孙洋团队打造Looki L1可穿戴设备,将自动驾驶逻辑用于生活场景,转化视听信号为模型上下文,构建用户专属数据飞轮,让AI实现主动共鸣。
无预训练模型拿下ARC-AGI榜三!Mamba作者用压缩原理挑战Scaling Law
CompressARC研究中,Mamba作者Albert Gu团队给出不同于大规模预训练的智能配方——最小描述长度(MDL)。一个76K参数、无预训练模型,在ARC - AGI - 1基准解决20%问题,获ARC Prize 2025第三名。
The Batch: 864 | GLM-4.5:一款开放的智能体竞争者
大型语言模型推动智能体能力交互竞赛正酣,中国 Z.ai 推出 GLM - 4.5 系列开源权重模型,在推理、编程等基准测试中表现出色,还介绍了其工作原理、研究和测试结果等。
EvaLearn:AI下半场的全新评测范式!
OpenAI研究员指出传统基准测试难衡量AI实际效用。复旦大学与字节跳动等团队提出全新评测范式EvaLearn,以连续问题求解为核心,构建问题并设评分标准,对九个前沿大模型研究有诸多发现。
ICCV 2025 | 清华&腾讯混元X发现「视觉头」机制:仅5%注意力头负责多模态视觉理解
本文聚焦多模态大模型,提出基于 OCR 任务量化注意力头视觉偏好的方法,发现仅不到 5%“视觉头”主导视觉理解。还提出 SparseMM 策略优化 KV - Cache 资源分配,经多基准评测,性能和效率表现优。
港股新贵押注物理AI,乐动机器人打造万亿市场空间的核心基础设施
物理AI时代,机器人需「读懂」物理环境,环境感知能力成竞争焦点。乐动机器人过去十年围绕此布局,有空间感知技术先发优势,其自研模型与架构构建数据飞轮,有望完成向感知基础设施平台的身份重塑。
ICLR 2026 Oral|大模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升
以DeepSeek - R1等为代表的大型推理模型存在过度思考问题,造成大量冗余计算。复旦大学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试中实现推理长度减半且性能提升。
技术·艺术· 算术:京东零售 AIGC 百亿素材供给实践
本文整理自 QCon 全球软件开发大会·2026 石孝钢演讲。京东零售面对百亿级商品素材供给难题,构建 Oxygen Vision 系统,从艺术、技术、算术三方面探索,实现日供超 1000 万素材,服务超 100 万家商家,核心 XTR 综合提升 29%。
万帧实时!流式3D重建天花板,被国产开源模型打破了
蚂蚁正式开源 LingBot-Map,这是基于几何上下文 Transformer 的纯自回归流式 3D 重建基础模型。它能在恒定内存下实现超万帧长视频实时三维重建,处理速度约 20 FPS,在多基准测试中超越现有流式方法。