「多步聚合训练」共找到 5661 篇相关文章
真可用!美团数字人模型开源,MV、电商等统统拿下
美团开源数字人视频生成框架 LongCat - Video - Avatar 1.5 版本,换音频编码器、加速推理,支持多任务与多场景。经770人评测,它在多维度领先对手,各方面表现均衡,效率与质量兼得。
JinaVDR: 一个图文混排文档搜索任务的基准集
现有文档检索基准大多只考虑纯文本,难以处理含图表等视觉信息的文档。JinaVDR 应运而生,它是图文混排文档搜索基准集,含多语言、多领域数据,可评估模型在复杂视觉文档的检索性能。
Qwen-Scope:看穿大模型的“小心思”
Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。
10步优化超越强化学习,仅需1条未标注数据!后训练强势破局
无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。
Ilya交卷!黄仁勋砸50亿押注SSI,首个模型疑本周发布
Ilya Sutskever创立的SSI或本周发布首个重磅模型,引发圈内关注。英伟达砸50亿美元合作,提升其算力。该模型基于测试时训练架构,能边学边进化,或终结大模型“预训练时代”。
AI真的能读懂人心吗?阿里通义最新研究成果揭示答案
文章聚焦多模态推理问题,如全局上下文理解不足和推理捷径问题。介绍阿里通义HumanOmniV2改进方案,涵盖全局上下文理解等方面,还详述冷启动、两阶段强化学习训练方案及数据集下载和训练方法。
无需多视角,单图重建可交互3D模型!南洋理工开源结构推理框架
南洋理工大学团队提出MonoArt,将单目可动物体重建建模为渐进式结构推理过程,通过四个关键模块逐步推理,无需外部先验,在PartNet - Mobility基准测试中表现领先,兼顾推理效率,还可用于下游任务。
OpenAI发布MRC超算协议,重塑10万GPU集群通信,AMD等合作推进
OpenAI联合AMD等发布MRC超算协议,它基于RoCE标准,打破传统网络局限,解决超大规模计算集群难题,降低成本与能耗。MRC有多平面网络等特性,已在多超级计算机部署,规范也已公开。
刷新世界记录!40B模型+20万亿token,散户组团挑战算力霸权
Nous Research推出Psyche网络,用区块链汇聚全球计算资源,启动40B参数大语言模型Consilience预训练,达20万亿token创纪录。还解决带宽瓶颈等问题,让AI训练去中心化,推动创新与民主化。
The Batch: 968 | Muse Code 想获取你的数据
Meta推出Muse Code编码框架及Muse Spark 1.2模型,有不同输入输出、功能和性能表现。提供不同档位价格,贡献者档位低价但数据用于训练。测试显示其单任务成本低,Meta此举或为获取编码训练数据。