开源动态7
Video - Holmes:大模型视频推理全不及格
量子位
AI 摘要
腾讯ARC Lab和香港城市大学:推出Video - Holmes测试大模型视频推理能力,规避现有痛点。测试里大模型全不及格,反映出其推理能力不足,相关资料代码已开源。
阅读原文 · 量子位
视频推理界的“福尔摩斯测试”:所有大模型,统统不及格 | 论文代码开源
腾讯ARC Lab和香港城市大学推出Video - Holmes,这是视频推理界的‘福尔摩斯测试’,能展现多模态大模型复杂视频推理能力的边界,规避现有Benchmark痛点,测试中所有大模型全部不及格,代码已开源。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
英伟达推理指南:华人团队方案成最优解
9月2日,英伟达技术博客上线《用投机解码做AI模型协同设计》,给出推理加速选型表。列入指南的核心方案多由华人团队主导,介绍了从外置草稿模型到n - gram查表法等方案,还提到硬件常数对模型架构的约束。
新智元
新闻资讯7
Meta发布Muse Spark 1.3,挑战谷歌模型
九月刚过3天就有五个前沿模型发布,Meta发布Muse Spark 1.3踢馆谷歌Gemini 3.8 Flash。它跑分提升大、成本低,性价比高,但也遭质疑,大模型下半场或比拼系统架构和智能体工程能力。
新智元
新闻资讯8
陈大年复出,小模型StartLux挑战大参数量模型
国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在信通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。
量子位
开源动态8
E - Commerce Bench揭秘大模型网店经营能力
为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异大,还发现单一指标会掩盖模型表现,评估基准潜力大。
千问大模型