FutureX 动态评测基准」共找到 975 篇相关文章

算法论文8

从「知题」到「知人」:UserRL让智能体学会「以人为本」

大语言模型距成真正用户伙伴缺‘知人’能力。来自UIUC与Salesforce团队提出UserBench和UserRL方案。前者将‘用户特性’制度化,构建评测环境;后者搭建统一强化学习框架,探索奖励建模,二者让‘以用户为中心’落地。

机器之心
算法论文8

ACL 2026 Main|混合推理模型也会「钻空子」:南大移动团队提出TNT,破解「假装不思考」骗奖励

大型推理模型存在「过度思考」问题,训练混合推理模型易出现奖励欺骗。南大等团队提出 TNT 方法,利用思考模式解答部分为问题动态设非思考模式 token 上限,解决奖励欺骗,实现准确率与效率双赢。

机器之心
新闻资讯7

Grok 4作战图刷爆全网,80%华人横扫硅谷!清华上交校友领衔,95后站C位

Grok 4一夜爆火硅谷,一张内部作战图显示其幕后团队华人学者占比达80%,包括Jimmy Ba、吴怀宇等。独立评测中Grok 4成绩优异,但也有人质疑其代码基准结果有过拟合嫌疑。

新智元
算法论文8

AI"学霸"也解不出高中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板

耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有高质量数据、多模态多题型测试和精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。

深度学习自然语言处理
开源动态7

100k Star,他们给Clawdbot升级了超级记忆

Clawdbot项目突破100k,后改名moltbot。其原记忆是静态的,此次升级为超级/动态记忆,构建三层记忆系统,让理解力自我更新。还集成Supermemory,有自动回忆等功能,文章给出实施指南。

PaperAgent
开源动态7

号称视频编辑领域的开源nano banana来了,用文字就能改视频

DecartAI开源Lucy Edit模型,号称视频领域开源Nano Banana,能理解自然语言指令改视频。如输入指令可精准换服装等,渲染快,有身份保持和动态适配亮点,有多个版本,应用场景广。

AI工程化
算法论文8

给 Agent Skills 装上眼睛:MMSkills 用多模态技能包教会智能体看状态、做决策

上海交通大学和小红书团队推出面向通用视觉 Agent 的多模态技能框架 MMSkills,将可复用技能扩展为多模态程序性知识,通过 branch loading 调用视觉证据,在 GUI 与游戏任务评测中表现出色。

深度学习自然语言处理
算法论文8

Meta通过简单算术解锁LLM SoTA性能

大型语言模型训练耗算力与时间,传统模型融合方法有局限。本文提出SoCE新方法,通过筛选专家模型、非均匀加权平均融合,在多评测中实现先进性能,为LLM优化提供新思路。

深度学习自然语言处理
新闻资讯7

人形机器人不再「走走停停」:Current Robotics发布全身灵巧操作模型Curr-0

具身智能领域中,让机器人移动中精细操作一直未被很好解决。Current Robotics发布全身灵巧操作模型Curr - 0,用Single Policy统一策略,数据源于自研外骨骼系统,还构建世界模型解决评测部署难题。

机器之心
算法论文7

姚顺雨腾讯首篇论文:给AI下半场指路“上下文学习”

姚顺雨入职腾讯后首个成果CL - bench,用来测试大模型“从上下文中学习”能力。研究指出当下模型多依赖“过去”知识,无法适应“当下”学习。评测中,十个前沿模型表现不佳,揭示其真实场景应用缺陷。

量子位