大模型数据」共找到 9982 篇相关文章

产品应用7

高考数学全卷重赛!一道题难倒所有模型,新选手Gemini夺冠,豆包DeepSeek并列第二

因网友质疑上次测评不严谨,此次用六款模型挑战含解答题的全套高考数学题。结果Gemini 2.5 Pro夺冠,Doubao和DeepSeek R1并列第二。解答题是失分重灾区,图像题难倒多模态模型

机器之心
新闻资讯8

CSDN 创始人蒋涛:中国开源十年突围路、模型战阿里反超 Meta,数据解析全球开源 AI 新进展

在GOSIM HANGZHOU 2025现场,CSDN创始人蒋涛发布两份报告。《2025全球开源发展报告(预览版)》显示美主导、中国崛起;《模型技术体系开源影响力榜单》中,Meta、阿里等表现突出,强调模型竞争关键在生态。

AI科技大本营
新闻资讯7

让GPT-4.1「头皮发麻的考试」!OpenAI给模型上强度,AI能赢吗?

OpenAI 公布 MRCR 评测标准数据集,其针对 AI 模型上下文能力进行「奥运会」级别测评。MRCR 提升了测试难度,能揭示 AI 能力边界,推动模型发展,帮助更合理应用技术。GPT4.1 在一些测试中表现出色,未来 AI 能力上限充满可能。

新智元
新闻资讯7

2025上半年模型使用量观察:Gemini系列占一半市场份额,DeepSeek V3用户留存极高

推特博主「karminski - 牙医」基于OpenRouter数据,分析2025年上半年模型API市场,涵盖总Token使用量、市场份额、细分领域用量、API接口使用趋势等,得出各模型表现及市场格局的观察结论。

Founder Park
算法论文8

ICML 2025 Spotlight | 多模态模型暴露短板?EMMA基准深度揭秘多模态推理能力

最新研究推出 EMMA 基准测试,揭示顶尖多模态语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距,视觉推理是核心瓶颈。

机器之心
算法论文8

ICML 2026 | 将多教师冲突转化为动态约束,破解多模态模型推理对齐难题

在多模态模型发展中,多教师知识蒸馏成提升性能关键,但教师模型存在“概念漂移”问题。悉尼科技学团队提出 APO 框架,将模型间“漂移”转化为动态负约束,解决多模态模型多师蒸馏概念对齐难题,工作被 ICML 2026 接收。

机器之心
新闻资讯8

中国团队引领太空算力:首次太空在轨部署通用模型,发2800颗卫星服务数亿硅基智能体

岁末年初,全球AI竞争聚焦太空算力,中美你追我赶。美国Starcloud宣布在太空跑通模型,中国国星宇航发布全球首个服务硅基智能体的太空算力网,计划用2800颗卫星服务数亿个硅基智能体,还实现通用模型在轨部署。

量子位
7

华为盘古模型:被芯片牵制的“千古”模型

华为盘古模型团队员工自曝内幕,称其受芯片限制,早期算力有限、训练困难。还指出内部存在造假、套壳等问题,如135B V2套壳Qwen 1.5 110B,pangu pro moe 72B套壳qwen 2.5的14b等,导致人才流失。

Agent的潜意识
开源动态8

以小博!Nanbeige4-3B重磅开源:硬刚Qwen3,挑战小模型能力新高度

近年来语言模型参数膨胀,成本升高,业界重注小语言模型。近日,Boss直聘南北阁模型实验室发布仅30亿参数的Nanbeige4 - 3B,在多方面媲美甚至超越通义千问Qwen3系列模型,开源印证小模型潜力。

AIGC开放社区
算法论文7

Reasoning模型可以Self-Train!

当前模型依赖人类标注数据,成本高且扩展难。论文探讨模型自我纠错、自主进化可能,提出自我奖励训练(SRT),用投票共识代替人类标注。在数学数据集上有效果,但高难度数据集出现问题,作者给出解决办法并开源代码。

深度学习自然语言处理