基准测试集」共找到 2446 篇相关文章

算法论文8

ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案

多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。

机器之心
开源动态8

开源模型终于有了自己的 Opus 时刻

智谱深夜发布的新一代旗舰模型 GLM - 5,此前以匿名模型 Pony Alpha 被开发者热测。2026 年编程大模型风向转变,GLM - 5 参数提升,测试成绩优异,实测能完成复杂工程任务,适配国产算力平台。

AGI Hunt
开源动态8

中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!

近日,中国科学院等全球顶尖机构发布手术视频原生基础模型SurgMotion。它依托全球最大手术视频数据,首次突破十亿级参数,覆盖17项核心手术任务,性能卓越,还在多领域形成生态共鸣。

机器之心
开源动态8

一图胜千言被实现了!DeepSeek-OCR用图片压缩文本,10倍压缩率

DeepSeek开源DeepSeek - OCR,用图片压缩文本达10倍压缩率且几乎不丢信息。它解决了以往视觉编码器的问题,架构清晰,数据丰富,性能测试亮眼,为解决大模型‘记性差’问题提供新思路。

AIGC开放社区
开源动态8

宇树科技开源UnifoLM-WMA-0机器人模型,离通用机器人又进一步

宇树科技开源UnifoLM-WMA-0模型,用神经物理网络让机器人理解力学规律。它支持两种模式,融合多模态信息,架构精妙。经测试性能强,已真机部署。开源降低门槛,有望推动行业发展。

AIGC开放社区
推荐文章7

从 Shopify 构建 Agent 的经验中可以学到的

Shopify 分享构建 Agent 经验,采用主流 Agentic Loop 架构。给出4条打造 AI 智能体核心建议,还指出工具控制在20个内,可用 SubAgent 分摊上下文;用人类标记结果作基准让 LLM 评估 Agent 生成结果。

宝玉AI
新闻资讯7

GPT-5“变笨”实锤,退休教授出了道井字棋送分题,结果它真送了

退休经济学教授用井字棋简单问题测试GPT - 5,其表现拉胯,与“博士级AI”宣传不符。后续操作离谱,或因OpenAI策略调整。此外,OpenAI在测ChatGPT新功能,奥特曼开始炒GPT - 6。

量子位
算法论文8

ICCV 2025 | 机器人自主探索未知复杂空间?GLEAM破解主动探索建图的泛化难题

文章聚焦机器人在未知复杂空间的自主探索建图难题。香港中文大学与上海人工智能实验室联合提出GLEAM,搭建GLEAM - Bench基准,设计通用策略,实现零样本适配未知空间,在多指标上超越先前方法。

机器之心
新闻资讯8

研究显示:AI 并没有提升编程效率,它反而让你变慢了19%

METR研究显示,16位资深开发者在真实项目测试中,使用AI工具效率降低19%。分析发现,编写提示词、等待响应等耗时多,保留代码仅44%。研究指出多因素致效率低,网友看法不一。

AGI Hunt
算法论文8

75%预训练数据都能删!Jeff Dean新作:全自动筛除低质量数据

Google DeepMind团队开发的DataRater可全自动评估数据质量,用元学习筛选有价值数据,提升模型训练效率。它能减少计算量、提高性能,在低质量数据效果佳,还能跨模型规模泛化。

新智元