「评测体系」共找到 1162 篇相关文章
GPT-5.4 仅 11.36%!当大规模工具生态变成迷宫,LLM Agent 还能完成长程规划吗?
PlanBench-XL 来自 UIUC 团队,将 LLM Agent 放入零售 API 世界,评测其长程规划能力。它考虑真实工具环境挑战,含 327 个任务等,发现多数模型规划难、恢复差等问题,并给出改进启示。
刚刚,DeepSeek开源OCR 2,首创Qwen编码的「双流架构」
年底 DeepSeek 开源新模型 DeepSeek - OCR 2,首创双流注意力架构,model&paper 一同发布。它重构视觉编码器,采用三阶段训练流程,在 OmniDocBench v1.5 评测及生产环境验证中表现良好。
突发!OpenAI大神姚顺雨,任腾讯首席AI科学家
OpenAI科学家姚顺雨入职腾讯,任首席AI科学家,兼AI Infra部、大语言模型部负责人。他是清华姚班学霸,研究智能体成果多,还曾提出AI进入‘下半场’,评测将更重要的观点。
VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块
视觉问答模型准确率提升,但高分可能源于记忆。浙江大学等团队提出 ReKey,保留真实场景,只更新决定答案的视觉线索,使评测面向未见过内容,且多数环节可自动完成。
达尔文.skill正式发布,一个无限进化的skill系统!
作者受Karpathy的autoresearch启发,开发了达尔文.skill系统,可自动评估和优化skill。它有五条原则、八维度评分体系,能批量解决skill质量问题,与Anthropic官方工具互补,现已开源。
OpenClaw登顶GitHub,满天飞的智能体Skills要怎样设计?
OpenClaw 4 个月获 250K+ Star 登顶 GitHub。智能体 Skills 给大模型装上程序化记忆,研究者解构其概念,阐述设计模式、获取调度逻辑,也指出安全威胁,呼吁建立客观评价体系。
多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品
现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。
桌面 Agent 的下一步:不是会操作,而是会调度工具
复旦大学和通义实验室提出 ToolCUA,让模型在 GUI 与工具调用间编排路径。它从已有 GUI 轨迹合成训练数据,设计奖励机制,在 OSWorld - MCP 评测中效率与准确率大幅提升,为 CUA 发展提供方向。
刚刚,阿里官方认领神秘「欢乐马」,来自ATH郑波团队
周二晚间,AI评测平台Artificial Analysis上,‘欢乐马’空降榜首引热议。现阿里官方认领,它是ATH郑波团队模型,正内测,近期将开放API。其在多项排行榜表现出色,支持四种视频生成模式。
联合AI天使会、对接百家顶级VC,「星火计划」正式启动招募
算泥社区联合AIGC开放社区发布「星火计划」,联合AI天使会等对接百家顶级VC,构建全链路服务体系。其有构建资本网络、深度辅导、提供品牌与资源等优势,现向早期项目开放征集。