长文本训练」共找到 2925 篇相关文章

开源动态8

世界模型和具身大脑最新突破:90%生成数据,VLA性能暴涨300%|开源

国产世界模型玩家获突破,VLA模型性能涨300%,90%训练数据由世界模型生成。极佳视界开源GigaWorld - 0及训练框架,在多方面优化,经对比性能领先,还验证其生成数据对具身任务的提升作用。

量子位
开源动态8

阿里开源Qwen3-Coder-Next,80B参数仅激活3B的MoE顶尖编程助手

阿里开源小型MoE代码模型Qwen3 - Coder - Next,总参数量800亿但仅激活30亿参数,在代码生成等任务表现出色。团队构建训练技术栈解决数据匮乏,模型训练分阶段,多领域专家模型能力整合,基准测试性能强劲。

AIGC开放社区
算法论文8

全新线性注意力范式!哈工深张正团队提出模感知线性注意力!显存直降92.3%!

哈工深张正团队联合多团队发布论文,提出 NaLaFormer 框架,解决线性注意力两大核心缺陷,保持线性复杂度同时精度超越,在多任务表现出色,如超分任务显存降 92.3%。

机器之心
产品应用8

快手发布Keye-VL-1.5,同量级SoTA,让模型真正看懂视频!

近年来,多模态大语言模型兴起,但视频理解仍是难题。快手Keye团队推出Keye-VL-1.5,通过Slow-Fast编码策略、渐进式四阶段预训练和全面后训练流程等创新,实现视频理解突破,综合性能领先。

深度学习自然语言处理
算法论文8

半在线RL新范式UI-S1,使得GUI Agent既稳定又规划

现有AI训练方法在GUI自动化中各有弊端,本文提出半在线强化学习范式,训练出UI - S1 - 7B模型,性能提升显著,还提出新评估指标SOP,是迈向实用化AI智能体的重要一步。

深度学习自然语言处理
开源动态8

北大、字节跳动联手发布SWE-Swiss:一把修复代码Bug的「瑞士军刀」,完整配方直指开源SOTA

北大、字节跳动等联合研究提出SWE - Swiss配方,用于训练解决软件工程问题的AI模型。32B参数的SWE - Swiss - 32B在SWE - bench Verified上准确率达60.2%,各训练环节效果显著,模型和数据将开源。

机器之心
算法论文8

字节Seed提出M3-Agent:像我们一样"记住"与"思考"的视频理解新范式

字节Seed提出M3 - Agent,这是首个融合实时视听输入、类人记忆构建与自主推理的多模态智能体。它模仿人类记忆机制,解决视频理解痛点,已被CVPR 2025收录并开源代码,为通用人工智能奠定基础。

深度学习自然语言处理
算法论文8

GRPO训练不再「自嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化

GRPO在视觉生成流模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务中表现良好。

机器之心
算法论文8

大模型推理上限再突破:「自适应难易度蒸馏」超越R1蒸馏,CoT语料质量飞升

本文从中兴通讯无线研究院「大模型深潜」团队切入,介绍了首创的「LLM自适应题目难度蒸馏」方法,该方法围绕「模型 - 数据动态匹配」提出了一条完整的CoT构建流程,显著提升了CoT语料的质量。

机器之心
算法论文8

量化噪声竟是RL秘钥?QeRL:高效强化学习新范式,一场噪声引发的性能革命

近年来,大语言模型在复杂推理任务中面临挑战,强化学习虽更接近人类推理过程,但训练“烧资源”。论文《QeRL》提出量化不仅能压缩模型、节省资源,还能增强模型探索能力,QeRL框架实现训练速度提升、内存占用减半。

深度学习自然语言处理