「评估模型」共找到 7920 篇相关文章
打破AI能力的惯性评估方式,红杉中国推出全新双轨基准测试xbench|甲子光年
红杉中国推出全新AI基准测试工具xbench,采用双轨评估体系,构建多维度测评数据集,追踪模型理论能力上限与Agent实际落地价值。还采用长青评估机制,首期发布两个核心评估集并给出综合排名,公开后邀各界完善。
瘦身不降智!大模型训推效率提升30%,京东大模型开发计算研究登Nature旗下期刊
京东探索研究院大模型研究登Nature旗下期刊。其提出系统与方法,经四大创新使大模型推理提效30%、训练成本降70%。成果支撑JoyBuild平台,可帮企业将通用模型转化为专业模型,加速商业化落地。
上海AI Lab发布混合扩散语言模型SDAR:首个突破6600 tgs的开源扩散语言模型
上海人工智能实验室提出全新范式SDAR,通过‘训练 - 推理解耦’融合AR模型高性能与扩散模型并行推理优势。实验证明,SDAR性能与原版AR模型持平或超越,还能加速推理,且已全面开源全系列模型。
世界模型混战,Momenta率先冲刺IPO
当下世界模型是AI领域热门且混乱的概念,主流路线有四类。Momenta的R7世界模型已量产,其CEO定位公司为物理AI基座模型构建者。Momenta率先冲刺IPO,商业模式正转型,为后续玩家提供价值评估体系。
多模态模型学会“按需搜索”,少搜30%还更准!字节&NTU新研究优化多模态模型搜索策略
字节与NTU优化多模态模型搜索策略,通过搭建工具、构建数据集及设奖励机制,用强化学习训练模型,使其按需搜索。实验显示,MMSearch - R1系统少搜30%还更准,为多模态大模型发展提供洞见。
智能投顾的大模型应用,为什么选择了“大小模型协同”?
大模型时代,金融智能投顾落地是技术与业务安全的双重挑战。北银金科高级算法专家尹辰轩表示采用“大小模型协同”架构,能在性能、准确性与合规间找平衡,还阐述了架构亮点、问题解决办法等。
大模型时代,通用视觉模型将何去何从?
过去通用视觉模型(VGM)是研究热点,想实现‘视觉模型大一统’。但大语言模型发展使研究热点转移,视觉‘独立性’被重新定义。清华鲁继文团队综述梳理其进展,探讨现状、挑战与应用潜力。
王小川:医疗行业对大模型有三大刚性要求,但通用模型一条都不达标
5月22日百川智能展示医疗大模型Baichuan - M4与AI家庭医生「百小医」。王小川指出通用大模型用于医疗有问题,医疗对大模型有低幻觉、强循证、会提问的刚性要求,而通用模型不达标。Baichuan - M4表现出色,百小医也有独特定位和优势,且与三家顶尖医院合作成果显著。
神秘模型「Pony Alpha」引外网热议,它会是国产大模型中的谁?
近日,全球模型服务平台OpenRouter上搜索第一的神秘模型「Pony Alpha」引外网热议,它是新一代通用大模型,在多方面表现突出且可免费使用。网友、AI猜测其身份众说纷纭,已有人用它做出惊艳案例。
蚂蚁dInfer框架,让扩散大语言模型推理速度再飙10倍,相同模型性能下超越自回归模型
蚂蚁开源dInfer框架,联合名校发论文阐述实现细节。它解决扩散模型推理难题,提出创新算法和系统优化策略,实验显示其推理速度远超Fast - dLLM和自回归模型标杆vLLM,代码已开源。