「MAC基准」共找到 945 篇相关文章
蚂蚁 | 提出代码检索/重排基准:CoREB,揭开高分榜背后的三大幻觉,现已接入MTEB
蚂蚁研究人员提出代码检索与重排评测基准CoREB,解决现有基准相关性软、数据污染、任务方向单一问题。它已集成进MTEB,收录19个模型×6个任务评测结果,为代码检索模型评估提供新基线。
FACTS 基准测试套件问世,用于评估大型语言模型的事实准确性
FACTS 基准测试套件由 FACTS 团队与 Kaggle 联合开发,基于原 FACTS Grounding Benchmark 增加三个新基准,可从四个维度评估大模型事实性。初步结果显示进展与挑战并存,多模态成难题。
OpenAI发布权威AI科研基准,扯下AI遮羞布:奥赛金牌≠一流科学家!
OpenAI在2025年12月16日发布FrontierScience基准,用超700道题从物理、化学、生物维度考验AI科研推理能力。评测分竞赛和研究赛道,初测显示GPT - 5.2领先,但前沿模型仍有诸多问题。
Unsloth-MLX:在Mac上微调LLM,代码无缝迁移到云端GPU
对于Mac用户,在原型实验阶段反复租云端GPU是资源浪费。开发者推出Unsloth - MLX,基于MLX框架,让Mac用户本地高效微调大模型,改一行导入语句就能无缝迁移代码到云端,还介绍项目特点、状态等。
GPT-5准确率不足40%!北大发布多模态、高难度化学基准SUPERChem
北大团队发布多模态、高难度化学基准SUPERChem,构建评估大语言模型化学推理能力新体系。测试显示,GPT - 5准确率仅38.5%,与低年级本科生相当,且模型在高阶推理有短板,该基准为模型优化指明方向。
InfoDeepSeek:首个开放网络环境下的智能体信息搜寻质量评估基准
上海交通大学与华为诺亚方舟实验室联合推出InfoDeepSeek,它是首个评估真实动态网络环境下智能体信息搜寻质量的基准。该基准有挑战性问题、真实动态环境等亮点,还开展实验揭示智能体行为特性。
T2R-Bench发布:业内首个由表格生成报告工业基准
为解决大语言模型将表格信息转化为报告的难题,研究团队提出“表格到报告”任务,构建双语基准T2R - bench,其涵盖多垂域表格,还设计评价指标体系,实验显示大模型在该基准上提升空间大。
在 Mac 上安装最新版 OpenClaw 并接入企业微信之后,一切都改变了
文章介绍在Mac上安装最新版OpenClaw及接入企业微信的方法。新版本功能增强,安装后可连接多种工具。接入企业微信后,能实现诸多功能,如分析股价、制定健身计划等,还能拓展写作等技能。
面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS'25
卫星星座成数字经济时代基础设施,但运行背后规划难题待解。北航刘偲教授团队提出首个大规模真实星座调度基准AEOS - Bench,训练内嵌时间约束的调度模型AEOS - Former,为‘AI星座规划’奠定新技术基准。
ICML 2025 | 清华、上海AI Lab提出专家级医学基准MedXpertQA,看o3、R1哪家强
本文由清华和上海AI Lab学者撰写,提出专家级医学基准MedXpertQA。现有医学基准难度和临床相关性不足,而MedXpertQA极具挑战、临床相关性高,构建严格,评测显示前沿模型在医学领域提升空间大。