「基准测试数据集」共找到 1347 篇相关文章
6.1B激活,三榜开源第一!蚂蚁·安诊儿医疗大模型发布
由浙江省卫生健康信息中心等联合研发的开源医疗语言模型AntAngelMed发布。它基于Ling - flash - 2.0,100B总参数仅激活6.1B达约40B密集模型性能,在多个权威医疗基准测评中居前列,采用三阶段训练流程,高效MoE架构。
AI Code要变天了,Meta首个代码世界模型登场!
Meta FAIR推出32B参数的代码世界模型(CWM),旨在探索世界模型如何改变代码生成和推理,code和mode已开源。在SWE - bench验证中表现优,能与更大规模或闭权重的LLM竞争,还介绍了训练、数据集等情况。
AI 取代不了放射科医生
人们曾认为AI图像识别技术会让放射科医生被淘汰,如杰弗里·辛顿预言应停止培训该类医生。但过去十年,放射科医生需求反而增加。文章以其为例,分析AI难取代的原因,如基准测试局限、医生工作复杂、AI落地困难等。
全球看中国,灵初智能用10万小时人类数据写下具身智能的中国答案
2026年,“世界模型”成具身智能高频词。灵初智能联合创始人陈源培认为其非核心方向,而是数据迁移工具。灵初关注人类操作数据转化,在10万小时量级上可大幅替代真机数据,还介绍了系统模块、数据集及商业化阶段等情况。
RL加持的3D生成时代来了!首个「R1 式」文本到3D推理大模型AR3D-R1登场
强化学习首次被系统性拓展到文本到3D生成领域,上海人工智能实验室等机构研究者提出首个强化学习增强的文本到3D自回归模型AR3D - R1,还提出Hi - GRPO范式和MME - 3DR基准,实验显示其性能优异。
中英双语、29项第一、像素级理解:360 FG-CLIP2登顶全球最强图文跨模态模型
360推出FG-CLIP2图文跨模态VLM模型,在八大类任务、29项测试中超越Google与Meta。它能像素级看图,中英文皆强且已开源。其优势源于高质量数据集和先进训练方法,还在多业务落地并开放API。
超越Claude 3.5和o1!8B模型靠「分层投票+测试时训练」逆袭
近日MIT研究者发现测试时训练在大模型应对复杂推理问题时,能分解任务提升回答准确率。8B的lemma3模型经此方法,在ARC和BBH数据集上性能显著提升,超Claude 3.5等。但该策略部署效率低。
刚刚,OpenAI正式发布o3-pro!奥特曼激动更新博客:温和的奇点
今日凌晨,OpenAI发布o3-pro,Pro订阅用户可通过ChatGPT和API使用。其在多项任务表现出色,但在ARC-AGI数据集上与o3相近且成本高。网友测试评价不一,此外OpenAI CEO奥特曼还发表博客展望AI未来。
GPT-5.5反杀Claude登顶,AI编码旧榜不准了?
Datacurve推出新基准DeepSWE,号称「零污染」,用113道原创题挑战旧编程榜单。它使GPT和Claude名次逆转,揭示旧基准验证误差大、存在作弊现象,虽有局限,但反映编程基准竞争转向抗污染和验证可信。
景不动人动,MLLM如何面对「移步换景」的真实世界?OST-Bench揭示多模态大模型在线时空理解短板
上海多所高校研究者提出 OST - Bench,从智能体探索场景动态在线视角挑战大模型能力。它更贴近真实世界,揭示主流多模态大模型在线时空理解短板,为未来模型发展指明方向。