FutureX 动态评测基准」共找到 975 篇相关文章

算法论文7

ICLR 2026 | 越推越快! 首个面向「Test-Time Scaling」的投机解码基准

文章指出推理阶段扩展(TTS)能提升推理大模型解决复杂问题的能力,但会产生大量冗余计算。为此提出首个面向TTS的投机解码加速综合基准,评测显示N - gram方法在特定场景加速潜力大,混合策略性能更优。

AI科技评论
产品应用7

数据合成篇|多轮ToolUse数据合成打造更可靠的AI导购助手

文章以租赁导购助理“小不懂”为例,介绍Tool Use训练数据合成方案。先分析训练数据的目标与难点,提出动态多智能体对话生成框架,阐述多轮数据、复杂问题合成及过滤方案,展示数据和模型效果,还提及未来工作方向。

阿里云开发者
算法论文8

密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25

清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。

量子位
开源动态7

12K Star 的 claude-seo:免费 SEO 审计能替掉哪些付费工具

2026年2月底GitHub上claude - seo仓库有3500 star,五个月后达12.3K star。该项目作者一人开发,能给站点做SEO审计。它把判断层抽出开源,审计后可直接改代码。不过也有动态渲染弱等问题。

AI Reading Hub
产品应用8

中文版Nano Banana来了?Qwen-Image-2.0炸场:1K长文本硬吃,中文生图彻底不拧巴了

AI生图曾有文本长易糊、指令复杂就出错、中文渲染差等问题。阿里新发布的Qwen-Image-2.0能处理1K token长文本,理解复杂指令,中文渲染佳,还能多图编辑,国际评测表现也靠前,阿里云百炼已开通API邀测。

量子位
开源动态7

智谱新模型也用DeepSeek的MLA,苹果M5就能跑

智谱AI上市后发布新成果,开源轻量级大语言模型GLM-4.7-Flash,API免费开放调用。该模型是30B总参数、3B激活参数的MoE架构,定位为“本地编程与智能体助手”,评测表现佳,采用MLA架构,多平台支持。

量子位
算法论文8

GUI智能体训练迎来新范式!半在线强化学习让7B模型媲美GPT-4o

浙江大学与通义实验室团队推出UI - S1,提出半在线强化学习训练范式。它融合离线与在线学习优势,用三项关键技术构建核心架构,新评测指标SOP更贴近真实表现,实验显示UI - S1 - 7B性能卓越,逼近GPT - 4o。

量子位
算法论文8

全球首个,连续时间具身世界模型!任意帧率自由生成

来自清华AIR与UC Berkeley BAIR的团队提出全球首个连续时间具身世界模型ODEWorld。它学习世界在每个时刻的变化方向与速度,能任意帧率自由生成,统一了离散模型分散的生成能力。

新智元
开源动态8

OPPO AI重磅发布:深度研究智能体,离“真正好用”还有多远?我们给大模型做了一次全身体检

2025年,Deep Research成AI热点,OPPO AI Agent Team对大模型评测。发布论文,开源评测基准FINDER和失败分类体系DEFT,揭示AI“装懂”“缺乏韧性”问题,还分析模型表现并给出发展建议。

深度学习自然语言处理
算法论文8

速度提升,能力却暴跌?扩散模型做智能体的残酷真相

南洋理工大学陶大程教授团队联合发布评测报告,揭示扩散语言模型在智能体能力上有系统性缺陷,落后自回归模型。还分析其失败原因,提出评测框架,明确能力边界并给出研究建议。

机器之心