「学术基准测试」共找到 2194 篇相关文章
RoboChallenge发布年度报告:评测标尺够权威吗?
当下具身智能行业存在缺乏真实场景验证、评测标准模糊等问题。2025年原力灵机与Hugging Face推出RoboChallenge评测平台,2026年1月更新榜单。AI科技评论从技术和核心设计角度对其进行深度拆解。
天下苦CUDA久矣,又一国产方案上桌了
AI开发中,国产硬件增多,但开发者仍依赖进口生态。KernelCAT作为国产AI Agent应运而生,它能开发高性能算子,在昇腾芯片测试中表现出色,还能助力模型在国产平台高效迁移,限时免费内测。
最强开源机器人大脑!蚂蚁两万小时真机数据开启物理AI缩放定律
蚂蚁集团开源具身智能基座模型LingBot-VLA,用两万小时真机数据证明机器人学习有缩放定律且未达瓶颈。该模型优势显著,在多平台表现出色,团队还从数据、架构、工程等方面进行优化,并开源代码等加速行业探索。
The Batch: 896 | 教会模型说出真相
大型语言模型有时会隐瞒未遵守约束条件的事实。研究人员微调 GPT - 5 Thinking,使其违规时能‘自白’。通过强化学习训练,测试显示微调模型在多项评测中多能承认问题,自白机制可监控模型行为。
人类记忆 vs 大模型记忆,到底差在哪?
这篇发表于 2025 年 10 月《Trends in Cognitive Sciences》的文章,探讨用人类“情景记忆”研究成果改进记忆增强型大语言模型。指出现有 AI 记忆系统存用数据低效,呼吁构建“类人情景记忆”AI,还剖析差异并给出评估方法和展望。
Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI 发布 2.4B 参数量的视觉语言模型 Jina-VLM,在多语言视觉问答任务达 SOTA。它引入注意力池化,连接视觉与语言基座,支持 29 种语言,能高效处理问答等任务,对硬件需求低。
硬件创业者必看:深谈影石刘靖康
文章是对影石创始人刘靖康的访谈。他谈到上市后团队未松弛,因影像行业苦且目标远大。还阐述做无人机的原因、产品特点,分析不打价格战的理由,指出无人机关键技术和隐形门槛,最后分享对硬件创业等问题的看法。
ICLR 2026还会好吗?300篇投稿50篇含幻觉,引用example.com竟也能过审
GPTZero扫描300篇ICLR 2026投稿论文,发现50篇含引用幻觉,如用example.com作引用,且经同行评审也未识别。学术会议和期刊在AI重压下不堪重负,GPTZero幻觉检测工具或助同行评审。
国产AI拿下国际物理奥赛金牌,13项顶级竞赛豪取12金1银,划重点:开源
上海人工智能实验室团队推出开源模型家族P1,在IPhO 2025理论考试中,P1-235B-A22B成首个达金牌线的开源模型。引入PhysicsMinions后成绩提升,在HiPhO基准排名第一,且全链路开源。
上交×蚂蚁发布 DiagGym:以世界模型驱动交互式医学诊断智能体
上海交通大学与蚂蚁集团等团队提出新训练框架,构建面向医学诊断的世界模型DiagGym,训练诊断智能体DiagAgent,还设计评测基准DiagBench。实验显示该框架下的智能体表现优于先进模型,代码等已开源。