大模型测试」共找到 9649 篇相关文章

算法论文8

绝对零监督Absolute Zero:类AlphaZero自博弈赋能模型推理,全新零数据训练范式问世

清华学 LeapLab 团队等提出全新推理训练范式 Absolute Zero,使模型实现「自我进化式学习」。基于此范式训练的模型 AZR,在代码生成与数学推理基准任务表现出色,缓解了模型对人工数据依赖难题。

机器之心
新闻资讯8

火线解析MiniMax招股书!全球领先模型成本只有OpenAI 1%,果然拳怕少壮

上海模型独角兽MiniMax通过港交所聆讯冲刺IPO。它是全球化AGI科技公司,全模态能力领先且成本低。技术上各模态模型表现出色,采用“模型即产品”模式获客,财务业绩向好,团队年轻高效。

量子位
新闻资讯7

太卷了!专属Coding的新一代Arena榜单来了,有国产模型登上榜首

模型编程竞争激烈,编码能力提升成军备竞赛。LMArena发布新世代模型编码评估系统Code Arena,国产模型智谱GLM - 4.6登上榜首,其编码能力获认可,彰显国产模型硬核实力。

机器之心
新闻资讯7

厂都在卷千亿模型,这家深圳企业却专啃“最后一公里”

在CITE 2026上,佑泰创始人张希立分享企业战略。佑泰与厂不同,走差异化路径,聚焦算力落地“毛细血管”,产品覆盖多应用方向,还将转型提供完整算力服务,积极布局信创,面对成本压力坚守契约。

芯师爷
开源动态7

Rex-Omni:用 3B 模型颠覆目标检测

长期目标检测依赖传统坐标回归模型,MLLMs方法存在不足。IDEA研究院提出30亿参数的Rex - Omni多模态模型,在零样本测试中表现超现有回归模型,还具备丰富语言理解能力,有独特设计和训练流程。

带你学AI
算法论文8

腾讯混元数字人团队发布Moral RolePlay基准,揭秘模型的「道德困境」

腾讯混元数字人团队和中山学推出「Moral RolePlay」测评基准,评估模型扮演多元道德角色能力,揭示顶尖AI模型演不好反派,暴露模型理解社会心理复杂性的局限,还给出未来对齐技术方向。

机器之心
开源动态8

腾讯混元CL-bench续作发布,让模型读懂你的日常生活

腾讯混元团队推出CL - Bench Life,用于精准衡量AI在现实生活中的“上下文学习”能力。测试12个语言模型,结果显示模型处理高噪声零碎context能力不足,揭示当前顶尖AI模型还远未读懂日常。

机器之心
算法论文7

1万tokens是检验长文本的新基准,超过后18款模型集体失智

Chroma团队研究发现,将上下文扩展至1万tokens,18款主流模型集体“失智”,“智商”非均匀下降,在一些节点会断崖式下跌。研究还设计四项对照实验,证明LLMs性能随输入长度增加显著且非均匀下降。

量子位
算法论文8

BIGAI & 中科团队提出 MILR: 测试时隐空间推理,让图像生成学会「边想边改」丨ICLR 2026

BIGAI与中科等团队提出MILR,通过测试时隐空间推理,在不更新模型参数下优化图文表示,提升复杂图像生成能力。该方法在多基准测试达SOTA,还探讨了测试时扩展与奖励模型,未来有诸多拓展方向。

AI科技评论
新闻资讯8

Runway深夜炸场:一口气发布5更新,首个通用世界模型来了

主攻AI视频与多媒体生成技术的独角兽Runway发布5更新,包括旗舰视频生成模型Gen - 4.5、首个通用世界模型GWM - 1等,展示了其在通用世界模型上的野心,刷新了视频生成指标。

机器之心