「评测范式」共找到 1556 篇相关文章
Github 4.1k star,SuperSonic AI×BI 大厂震撼开源
SuperSonic 是腾讯音乐开源的下一代 AI+BI 平台,融合 Chat BI 与 Headless BI 两种范式。它解决了传统 BI 工具复杂、数据口径不统一等痛点,有丰富功能和技术优势,适用于多业务场景,开源优势明显。
多模态模型挑战北京杭州地铁图!o3成绩显著,但跟人类有差距
近年来,多模态大模型在多种场景取得进展,但能否‘看懂图’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁图理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。
具身智能“高考”难疯了!人类100分,最强模型12.8
原推出RoboTwin系列基准的团队带来RoboDojo,这是统一的仿真+真实世界机器人操作评测基准。它设42个仿真任务、18个真实任务,让30个主流策略竞技,结果显示机器人距通用操作差距大。
DeepSeek急招Agent方向!一口气放17个岗位,重度Vibe Coding用户优先
DeepSeek一口气开放17个招聘岗位,核心聚焦Agent方向,覆盖算法研究、数据评测、基础设施等全链条。岗位要求显示其Agent布局从研究落地到能力建设,还追求数据闭环与技术栈全面布局。
ICLR 2026|在「想象」中进化的机器人:港科大×字节跳动Seed提出WMPO,在世界模型中进行VLA强化学习
香港科技大学 PEI - Lab 与字节跳动 Seed 团队提出 WMPO 新范式,可让具身智能在‘想象中训练’,解决传统 VLA 训练瓶颈,目前论文、代码与模型均已开源。
让AI像人类画家一样边画边想,港中文&美团让模型「走一步看一步」
在文生图和视频生成领域,现有模型处理复杂任务常出错。港中文和美团团队提出TwiG范式,将视觉生成拆解为“生成-思考-再生成”循环,经实验验证有效,有望拓展到更多领域。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。
AI如何看懂足球?上海交大团队打造Multi-Agent系统,全面解析“美丽足球”!
现有足球AI研究存在不足,上海交大团队打造Multi - Agent系统。他们构建SoccerWiki知识库、SoccerBench评测基准和SoccerAgent多智能体系统,该系统多工具协作,实验中碾压GPT - 4,数据和代码将开源。
从答题到做实验:SciAgentGym让大模型进入科学工作流
复旦大学NLP实验室提出SciAgentGym,为科学智能体搭建工作流环境,还设计了评测集SciAgentBench。实验显示模型接入工具能提升成功率,但长流程任务性能下降。论文还提出SciForge构建训练数据,提升了模型表现。
蚂蚁集团领投,光轮智能20亿美元估值引领全球具身数据基础设施|甲子光年
具身智能市场逻辑生变,从关注模型和本体转向数据与评测基础设施。光轮智能获蚂蚁集团领投,估值超20亿美元。其构建完整闭环,参与国际标准制定,打造物理AI教育系统,引领产业发展。