「长序列训练」共找到 2682 篇相关文章
边打字边出片,交互式生成长视频!英伟达联合MIT开源新SOTA
AI拍长视频不再难!英伟达联合MIT推出LongLive,可实时交互生成流畅画面,解决传统方法卡顿、不连贯等痛点。它能生成15秒到240秒视频,性能达SOTA,还靠三把“钥匙”解决长、顺、快难题。
无预训练模型拿下ARC-AGI榜三!Mamba作者用压缩原理挑战Scaling Law
CompressARC研究中,Mamba作者Albert Gu团队给出不同于大规模预训练的智能配方——最小描述长度(MDL)。一个76K参数、无预训练模型,在ARC - AGI - 1基准解决20%问题,获ARC Prize 2025第三名。
新范式来了!新能量模型打破Transformer++扩展上限,训练扩展率快35%
研究训练新能量模型 EBT,为输入和预测分配能量值,模拟思考过程。它有跨模态、跨任务通用性,训练扩展率比 Transformer++ 高 35%,推理性能提升 29%,还在多任务中表现出色,是扩展模型能力新范式。
AI 基础知识从 0.6 到 0.7—— 彻底拆解深度神经网络训练的五大核心步骤
文章以 PyTorch 手写数字识别代码为引,深入剖析深度神经网络训练的五大核心步骤,涵盖前向传播、计算损失、反向传播、更新参数和循环训练,还介绍激活函数、Dropout 等概念及正则化、优化器等技术。
突破长视频生成瓶颈:南大、TeleAI推出全新AI生成范式MMPL,让创意一镜到底
当前AI长视频生成面临质量骤降、细节崩坏、生成低效等问题。南京大学联合TeleAI推出MMPL新范式,首创“宏观规划、微观执行”双层生成架构,实现分钟级高质量长视频稳定生成,效率显著提升。
OpenAI新模型,被曝秘密训练中!万字硬核长文直指o4核心秘密
SemiAnalysis爆料,OpenAI正训练规模介于GPT - 4.1和GPT - 4.5间的新模型,下一代推理模型o4基于GPT - 4.1训练。强化学习成推理模型进步功臣,但面临基础设施瓶颈,奖励函数难定等问题。
Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra,吞吐最高提升 3 倍
大语言模型走向“完成任务”,Agentic RL 后训练让系统工作负载不稳定。港中文和恒生大学团队提出 Libra 资源管理系统,统一优化训练与 rollout,在多任务中提升吞吐,论文与代码已公开。
两个LLM互相对线,推理能力起飞:康奈尔团队发布大模型版类GAN训练法
康奈尔大学团队提出面向大语言模型的类GAN训练框架PasoDoble,通过对抗训练两模型提升推理能力,不依赖外部监督,在多模型实验中显著提升数学基准表现,不过在部分领域外任务有局限。
EMNLP2025 | 揭开LLM训练数据中的中文污染真相,有比“您好”高2.6倍的token?
近年来,大型语言模型虽成功,但训练数据易混入不良内容。论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》探索此问题,定义PoC Token,开发PoCDetect和PoCTrace工具,揭示LLMs训练数据污染情况。
蚂蚁专用模型超越o3!仅用2K训练样本刷新医疗AI榜单纪录
蚂蚁集团联合团队发布《MedResearcher-R1: Expert-Level Medical Deep Researcher》报告,其医学AI智能体MedResearcher-R1用2100条训练样本在医疗基准测试反超通用大模型,靠数据、工具、训练方法三大创新实现突破。