多阶段训练」共找到 5953 篇相关文章

算法论文7

翁荔陈丹琦加盟的840亿AI公司,公开第二篇论文

明星创业公司Thinking Machines公开第二篇研究论文,主题为“Modular Manifolds”,通过统一框架约束和优化网络不同层/模块,提升训练稳定性与效率。论文提出模块化流形思路,若应用于大模型,训练效率和稳定性将大幅提升。

量子位
产品应用7

智能PPT生成系统

MultiAgentPPT是基于A2A + MCP + ADK的智能体系统,能流式并发生成高质量PPT。它通过智能体协作,从大纲生成到内容汇总,提高效率与准确性,还介绍了使用界面、项目结构、快速开始步骤等。

GitHubStore
开源动态8

真可用!美团数字人模型开源,MV、电商等统统拿下

美团开源数字人视频生成框架 LongCat - Video - Avatar 1.5 版本,换音频编码器、加速推理,支持任务与场景。经770人评测,它在维度领先对手,各方面表现均衡,效率与质量兼得。

AIGC开放社区
开源动态8

JinaVDR: 一个图文混排文档搜索任务的基准集

现有文档检索基准大只考虑纯文本,难以处理含图表等视觉信息的文档。JinaVDR 应运而生,它是图文混排文档搜索基准集,含语言、领域数据,可评估模型在复杂视觉文档的检索性能。

Jina AI
开源动态8

Qwen-Scope:看穿大模型的“小心思”

Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。

千问大模型
算法论文8

10步优化超越强化学习,仅需1条未标注数据!后训练强势破局

无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。

新智元
新闻资讯8

Ilya交卷!黄仁勋砸50亿押注SSI,首个模型疑本周发布

Ilya Sutskever创立的SSI或本周发布首个重磅模型,引发圈内关注。英伟达砸50亿美元合作,提升其算力。该模型基于测试时训练架构,能边学边进化,或终结大模型“预训练时代”。

新智元
开源动态8

无需视角,单图重建可交互3D模型!南洋理工开源结构推理框架

南洋理工大学团队提出MonoArt,将单目可动物体重建建模为渐进式结构推理过程,通过四个关键模块逐步推理,无需外部先验,在PartNet - Mobility基准测试中表现领先,兼顾推理效率,还可用于下游任务。

新智元
新闻资讯8

OpenAI发布MRC超算协议,重塑10万GPU集群通信,AMD等合作推进

OpenAI联合AMD等发布MRC超算协议,它基于RoCE标准,打破传统网络局限,解决超大规模计算集群难题,降低成本与能耗。MRC有平面网络等特性,已在超级计算机部署,规范也已公开。

AIGC开放社区
开源动态8

刷新世界记录!40B模型+20万亿token,散户组团挑战算力霸权

Nous Research推出Psyche网络,用区块链汇聚全球计算资源,启动40B参数大语言模型Consilience预训练,达20万亿token创纪录。还解决带宽瓶颈等问题,让AI训练去中心化,推动创新与民主化。

新智元