「评测体系」共找到 1157 篇相关文章
震撼发布!最大人体动作数据集 MotionMillion 正式登场
上海交通大学研究团队构建高效标注流程,发布最大人体动作数据集MotionMillion,含超2000小时、200万条文本 - 动作配对数据。还推出评测体系MotionMillion - Eval,训练70亿参数动作生成大模型,刷新SOTA。
从「片段生成」到「长视频漫游」:OmniRoam探索轨迹可控的长视频生成新范式
在生成式视频发展中,长时序视频生成面临挑战。研究者提出 OmniRoam 新方法,通过全景表示和分阶段生成框架,提升视频时空一致性,还构建数据评测体系,实验表现优,有效率和 3D 应用潜力。
具身智能机器人年度总结,来自英伟达机器人主管
英伟达机器人主管Jim Fan在2025年末判断机器人领域仍处蛮荒时代。他指出该领域缺乏统一评测体系,硬件进展快但可靠性不足限制软件迭代,VLM→VLA技术范式有问题,还分享了数据、模型等方面情况。
你的 Harness 工作流真的在进步吗?我们用一场考试撕掉了遮羞布
文章指出Harness工作流常靠‘主观vibes’驱动,缺乏有效评价体系。为此推出Harness Eval评测系统,包含出题、答题、改卷等环节,形成闭环,帮助工作流持续改进,还能提升整体通过率。
openJiuwen社区开源新招:重磅发布JiuwenSwarm,拉开群体智能“养蜂”序幕
openJiuwen社区开源蜂群智能体JiuwenSwarm,落地Coordination Engineering范式。它有全栈技术体系,支持人以HOTS和HITS模式参与协同,实战效果佳,且在评测中表现亮眼,全套能力开源。
AI如何看懂足球?上海交大团队打造Multi-Agent系统,全面解析“美丽足球”!
现有足球AI研究存在不足,上海交大团队打造Multi - Agent系统。他们构建SoccerWiki知识库、SoccerBench评测基准和SoccerAgent多智能体系统,该系统多工具协作,实验中碾压GPT - 4,数据和代码将开源。
智谱发布龙虾基座模型GLM-5-Turbo,还适配了一个养龙虾的盒子
智谱发布专为龙虾场景深度优化的基座模型GLM - 5 - Turbo,从底层训练重塑,增强四项核心能力。发布评测基准ZClawBench,模型表现领先。还推出龙虾套餐和安全管理体系,助力企业实现算力自由与安全管控。
这个免费的任务助手登顶 SuperCLUE-XClaw 榜单
近日,SuperCLUE - XClaw发布最新测评榜单,百度文心助手在十个参评的国产龙虾产品中夺冠,获97.62分。SuperCLUE是关注中文大模型评测的第三方体系,其榜单受业内关注。文心助手还是免费的。
拒绝传统 Router“瞎指挥”,多智能体如何实现智能任务分配?
企业级多智能体系统瓶颈常是负责分发任务的传统 Router 太“傻”,搞不定跨域、解不了冲突、跟不上变化。腾讯云开源 TCAR 智能路由模型,它先推理再选 Agent 集合,经多数据集评测表现出色,还提供完整开源范式。
AIGC全生命周期业务风控白皮书,从备案到运营的合规与安全实践
2025年9月15日《人工智能安全治理框架》2.0版发布,为AI风险防控指明方向。数美科技发布《AIGC全生命周期业务风控白皮书》,构建全生命周期业务风控体系,涵盖合规备案、安全评测、账号与内容风控等多方面。