大模型评估」共找到 9355 篇相关文章

产品应用8

比肩Claude Opus:阶跃星辰最强模型Step 3.5 Flash发布

阶跃星辰发布最强模型 Step 3.5 Flash,参数强,性能与前沿顶级模型并驾齐驱。其架构平衡算力与智力,有独特注意力布局;基础设施保障训练稳定;强化学习激发智能体潜能;评测数据显示战斗力强,未来还将持续优化。

AIGC开放社区
新闻资讯8

AI秒破18世纪「天书」账本!谷歌新模型盲测刷屏全网

谷歌AI Studio上一神秘模型引发关注,它识别200多年前商人的「天书」账本,修正格式错误与模糊表述,推理能力令历史学家震惊。该模型解决手写识别和推理两难题,或为谷歌将推的Gemini - 3。

新智元
新闻资讯7

Claude与人类共著论文,苹果再遭打脸!实验黑幕曝光

苹果一篇质疑模型推理能力的论文引发争议。Open Philanthropy研究人员联手Anthropic发表论文,揭露苹果论文三缺陷,指出部分测试无解却让模型“背锅”,还给出正确评价模型推理能力的方法。

新智元
开源动态8

顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤

UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。

AINLPer
新闻资讯7

DeepSeek-R2!?神秘模型惊现竞技场,真实身份引网友猜测

模型竞技场秘密上线神秘模型steve,对话中它称来自DeepSeek。网友热烈讨论其身份,有R2、V4等猜测。同时,因CEO不满及可能缺芯片,DeepSeek的R2再度延期。

量子位
8

超越英伟达B200!AMD最强AI芯:1.6倍内存、模型推理快30%,奥特曼都来站台

AMD发布最强AI芯片MI350X和MI355X,号称模型推理比英伟达B200快30%,内存是其1.6倍。该系列本月初已批量出货,还发布ROCm 7软件栈。AMD还预告明年推MI400系列,由其与OpenAI联合研发。

量子位
算法论文8

均值至上假繁荣!北新作专挑难题,逼出AI模型真本事

当强化学习成模型后训练核心工具,主流方法陷入「均值优化陷阱」,推理能力停滞。北团队提出RiskPO,将风险规避理念融入优化目标,用MVaR+捆绑策略双管齐下,三任务表现优异。

新智元
算法论文7

CodeClash 通过多轮编程竞赛对型语言模型进行基准测试

评估型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让多个 LLM 在多轮比赛中较量,涉及多种代码竞技场,还评估模型分析代码库能力,未来将处理更代码库。

InfoQ
开源动态8

智能必须基于世界模型?我们和蚂蚁灵波团队聊了聊

上周图灵奖得主 Yann LeCun 认为真正的智能应能在脑海推演,而语言模型难以触及真实世界。2026 年初,蚂蚁灵波连续四天开源四款具身智能模型,探索从物理交互构建智能的新路径。

机器之心
开源动态8

没想到,最Open的开源新模型,来自小红书

向来低调的小红书昨日开源首个自研模型 dots.llm1,它是中等规模的 MoE 模型,在较小激活量下性能良好。其开源力度堪称行业最,还介绍了数据处理、训练优化等多方面技术细节。

机器之心