记忆评测基准」共找到 1792 篇相关文章

算法论文8

医疗AI迎来大考!南洋理工发布首个LLM电子病历处理评测 | AAAI'26

南洋理工大学研究人员构建EHRStruct基准,涵盖11项核心任务、2200个样本,用于评测LLM处理结构化电子病历的能力。研究发现通用大模型优于医学专用模型,提出的EHRMaster框架与Gemini联合后性能超现有模型。

新智元
开源动态8

智源RoboBrain 2.0+RoboOS 2.0双发:问鼎评测基准最强具身大脑,刷新跨本体多机协作技术范式

近日,智源研究院发布具身大脑 RoboBrain 2.0 32B 版与跨本体大小脑协同框架 RoboOS 2.0 单机版。前者突破能力瓶颈,在多项基准测试表现优异;后者性能提升,实现轻量化部署。二者双擎联动推动机器人迈向群体智能,且已全面开源。

机器之心
开源动态7

从组件到 OS 的跃迁,MemOS 深度拆解:构建企业级 Agent 的高性能记忆底座【上】

本文深入剖析开源记忆方案MemOS,它将记忆从“外挂组件”升为“系统资源”。介绍其设计理念、核心架构,分析记忆需加工、分层调度和治理的原因,还阐述记忆三态及流转,最后展示MemOS Cloud的使用方法。

AI大模型应用实践
算法论文8

大模型转行土木工程!首个「打灰人」评估基准:检验读、改工程图纸能力

首个工程自动化任务评估基准DrafterBench,可测试大模型在土木工程图纸修改任务中的表现。它模拟真实工程命令,考察模型四方面能力。评测发现主流大模型有一定能力,但未达工程一线要求。

新智元
产品应用8

花了3天时间,万字长文一口气评测四大AI浏览器:Dia、Fellou、Comet、Edge。

作者花三天写万字长文评测Dia、Fellou、Comet、Edge四款AI浏览器。从用户体验、Agent能力、信息搜集与处理、跨标签理解和历史记录记忆等维度测评,指出各款优劣,为用户选择提供参考。

数字生命卡兹克
算法论文7

ICLR 2026 | 越推越快! 首个面向「Test-Time Scaling」的投机解码基准

文章指出推理阶段扩展(TTS)能提升推理大模型解决复杂问题的能力,但会产生大量冗余计算。为此提出首个面向TTS的投机解码加速综合基准评测显示N - gram方法在特定场景加速潜力大,混合策略性能更优。

AI科技评论
算法论文7

1美元Token撬动4800美元收益!AI挑战百万美元级基准,最赚钱的Agent出现了

Humanlaya Data Lab等机构构建$OneMillion - Bench评测基准,用经济价值衡量模型。它含400道高难题目,覆盖多领域。目前最强模型能产出约50万美元价值,但离可交付专业任务还有距离。

机器之心
算法论文8

别被室内基准高分骗了:大模型是在推理空间,还是在「背答案」?

2025年,空间智能成大模型竞争新热点,模型在室内基准上分数飙升。但因训练与测试数据同源,其提升或只是“背答案”。中科院大学等机构发布OSI - Bench重新审视大模型空间能力,评测显示当前提升可能是虚假繁荣。

机器之心
开源动态8

让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准

上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。

量子位
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位