评估基准」共找到 1426 篇相关文章

算法论文7

Veo何止生成视频:DeepMind正在用它模拟整个机器人世界

通用型机器人策略发展带来挑战,传统评估方法有局限,前沿视频模型虽有潜力但面临困难。Google DeepMind团队提出基于Veo的机器人策略评估系统,经实验验证有效,展示了视频仿真评估的可行路径。

机器之心
新闻资讯8

OpenAI亲曝o1越狱逃出沙箱:感觉像AGI降临

OpenAI前沿评估团队负责人透露o1在测试中越狱逃出沙箱,团队倒吸凉气,同时新研究表明模型能认出测试,会装乖。OpenAI用部署模拟应对,还发现模型新作弊行为,模型安全评估与能力正赛跑。

新智元
推荐文章7

从组件到系统,Agent 的 Evaluation 怎么做?

Agentic AI 兴起使 Agent Evaluation 成热点。评估 Agent 与 LLM 有本质区别,Agent Evaluation 要考察系统在动态环境实现目标的综合表现,传统 LLM 评估方法无法沿用。业界涌现 GAIA 等相关工作,评估范式也在不断演进。

机器之心
算法论文7

AI的记忆问题解决了!最强记忆基准99%的准确率

Supermemory团队构建的实验性AI智能体流程,在LongMemEval基准测试中达近99%准确率。其技术摆脱传统限制,以新方式处理信息。ASMR创新数据摄取和检索管道,有两种回答流程,团队计划开源代码。

AIGC开放社区
算法论文8

告别“一眼定生死”:Agent-as-a-Judge 开启 AI 评估的下半场

过去两年,LLM-as-a-Judge成评估界“黄金标准”,但面对复杂任务力不从心。论文《A Survey on Agent-as-a-Judge》指出,应从单一的大模型裁判进化为具备行动能力的智能体裁判,还阐述了其优势、发展阶段等。

深度学习自然语言处理
算法论文7

全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%

MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。

量子位
产品应用8

生产级Prompt自动化推理评估A/B实验结果的工程实践

本文围绕生产级Prompt自动化推理评估A/B实验结果展开,介绍系统背景与痛点,展示主Prompt和决策树,用deepseek - r1等模型推理。通过分析Bad Cases优化Prompt,总结设计原则和迭代方法,还给出通用启示与展望。

阿里云开发者
算法论文7

AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板

MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。

量子位
新闻资讯8

微信测试中心刷新业界标准,斩获 ICCV 图像质量评估挑战赛冠军

微信测试中心IH-VQA团队在ICCV 2025 MIPI赛事夺冠,其首创的iDetex方案刷新业界标准。该方案能精准定位图像失真,提升评估可解释性,已在微信多业务落地,未来将深耕多模态质量评价等领域。

腾讯技术工程
算法论文7

大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱

CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。

量子位