K2.5模型」共找到 9186 篇相关文章

算法论文7

多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合

清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。

量子位
新闻资讯8

字节暂停 Seedance2.0 全球发布,回应武汉全员被裁;曝梁文锋将携 DeepSeek V4 撞上姚顺雨;央视 315 曝光黑灰产“养号工厂” | AI周报

本期 AI 周报涵盖多领域动态。模型方面,DeepSeek-V4 将上线,姚顺雨将发布混元新模型;字节因版权纠纷暂停 Seedance 2.0 全球发布。企业动态有腾讯云模型调价、微信研发自有模型等,还有多起融资、收购事件。

AI前线
产品应用8

豆包 Seed 2.0 来了:字节模型跨越鸿沟

春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。

MacTalk
新闻资讯8

Anthropic发布Fable 5.1:科研、编程能力翻倍,成本最高降45%

当地时间9月1日,Anthropic推出Claude Fable 5.1和Claude Mythos 5.1。Fable 5.1科研、编程能力翻倍,成本最高降45%,还能解决实际问题,此次模型竞争转向多方面综合较量。

DeepTech深科技
产品应用8

英伟达帮你省钱,让大模型推理「短而精」,速度快5倍

过去大模型推理追求长链思维,导致推理链长、Token消耗大、响应慢。英伟达研究院的DLER研究给出解决办法,通过强化学习优化方法让模型‘短而精’,推理长度减超70%且准确率不变,还适用于大模型

机器之心
新闻资讯8

叛变!OpenAI亲儿子竟然选了Kimi K3

OpenAI投资的法律AI公司Harvey,首个自研模型Harvey Tenet选中国开源模型Kimi K3作底座。因原用闭源模型成本高、有竞争风险。Tenet训练成本低、性能佳,显示出可复制路径。

新智元
算法论文7

多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品

现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。

量子位
新闻资讯7

顶模 Fable 5.1发布,到底强了多少?

昨晚,Anthropic发布Fable 5.1和Mythos 5.1,这代沿用Fable 5参数,性能提升聚焦长任务,还降低缓存读取价。它在游戏、视频等多个领域表现出色,与同类模型对比进步明显,虽价格贵,但能力、速度有提升。

鲸选AI
新闻资讯7

5Y News|地瓜机器人完成1.2亿美元B1轮融资

日前,地瓜机器人宣布完成1.2亿美元B1轮融资,A、B轮融资总额达2.2亿美元。本轮融资汇聚多方资本,将支撑其全栈技术研发与产品迭代。它构建完善产品体系,与头部客户合作成果丰硕,还和地平线深度合作。

五源资本 5Y Capital
新闻资讯8

Open AI 新模型在 IMO 2025 上获得金牌!

OpenAI新模型在2025年国际数学奥林匹克(IMO)中达金牌水平,测试时不借助工具、不连互联网,且不太可能存在数据污染。该模型解决6题中的5题,非GPT - 5,近期也不发布。

歸藏的AI工具箱