SFT阶段」共找到 780 篇相关文章

开源动态8

视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理

快手开源能看懂视频并跨模态推理的大模型Keye-VL 1.5,其有时序定位、描述和推理能力,跑分领先。采用三段式架构和Slow-Fast编码策略,经四阶段预训练和多阶段后处理,团队成果多,推动多模态技术落地。

量子位
算法论文8

字节Seed新作:模型合并如何改变大模型预训练范式

字节跳动Seed团队在arXiv发表论文,提出预训练模型平均(PMA)技术。该技术将模型合并引入预训练阶段,可提升性能、预测衰减阶段表现,还能解决训练问题。不过,高学习率影响和强化学习应用待研究。

机器之心
算法论文7

The Batch: 939 |在推理阶段学习长上下文

大型语言模型处理长上下文时通常准确性降低、速度变慢,研究人员提出TTT - E2E方法,通过推理时训练模型将上下文压缩到transformer权重中,还展示了其运作方式、测试结果等。

DeeplearningAI
算法论文8

超低标注需求,实现医学图像分割!UCSD提出三阶段框架GenSeg

GenSeg用AI生成高质量医学图像及对应分割标注,在仅有几十张样本时也能训练出媲美传统深度模型的分割系统,显著降低医生手工标注负担。它是通用、与模型无关的框架,可集成到现有分割模型。

新智元
算法论文8

首次结合RL与SFT各自优势,动态引导模型实现推理⾼效训练

新一代大型推理模型在复杂推理有进展,核心是ZERO - RL训练法。华为香港研究所小艺团队等合作推出GHPO算法框架,融合在线强化学习与模仿学习,解决了RLVR方法局限,提升模型训练效果,代码数据开源。

机器之心
算法论文7

ICML'25 | 告别手动SFT!一句话得到你的专属大模型LoRA

传统微调方法开销大、部署难,Text-to-LoRA (T2L) 框架应运而生。它基于自然语言指令对 Transformer 模型即时适配,有三种架构变体,采用两种训练方法,实验显示其在多维度表现有效。

PaperAgent
新闻资讯8

LiblibAI 母公司完成近 3 亿美元融资:AI 应用层开始进入「收入说话」的阶段

近日,演语科技披露近3亿美元B+轮融资,投后估值超20亿美元。其旗下有LiblibAI、LibTV、星流等业务,已构建AI创意内容生产应用矩阵。截至2026年5月,ARR达3亿美元,收入年同比增超3000%。

AI科技评论
产品应用8

Artificial Analysis 榜单第二,SkyReels-V4 宣告 AI 视频进入「全栈统一」阶段

昆仑天工的 SkyReels-V4 在 Artificial Analysis 文生视频榜单排第二,ELO 评分 1090。它有「运动参考」能力,能覆盖视频创作全工作流,背后靠统一拼接框架和双流 MMDiT 架构,体现 AI 行业「统一」趋势。

Founder Park
算法论文8

斯坦福&英伟达提出新范式:推翻Scale Law,在“推理”阶段自我进化,超越人类专家

斯坦福和英伟达提出 TTT - Discover 新范式,允许模型在测试时继续训练,针对难题‘进化’。它设计了自适应熵目标函数和 PUCT 状态复用组件,实验在多领域碾压人类专家与同行,但在部分领域落地有局限且计算成本高。

深度学习自然语言处理
算法论文8

刚刚,OpenAI找到控制AI善恶的开关:ChatGPT坏人格在预训练阶段已成型

OpenAI最新论文揭示控制AI“善恶”开关。研究发现训练模型在某领域答错题,会致其在其他领域“学坏”,还找到“毒性人格特征”。同时给出解决办法,能让模型恢复正常。

量子位