「动态训练策略」共找到 3047 篇相关文章
用 Docker 跑大模型训练,Unsloth 解决了环境配置难题
Unsloth AI 发布 Docker 镜像版本,解决本地训练大模型环境配置难题。拉镜像就能训练,依赖和示例 notebook 都打包好。使用简单,不过有暂不支持 Mac 系统等限制,单卡 NVIDIA GPU 场景较适用。
自定义轨迹驱动AI视频生成,ATI无需训练适配多种生成模型
字节提出视频生成运动控制统一框架ATI,通过轻量级运动注入器将用户定义轨迹投影至预训练图像 - 视频生成模型潜在空间,实现协调控制。用户指定关键点及路径控制运动,无需重新训练,适配不同架构。
RL成本降幅超90%!Meta提出Agent训练新范式DreamGym
传统强化学习(RL)训练LLM Agent面临成本高、任务多样性不足等挑战。Meta团队提出DreamGym框架,以经验合成为核心,通过三大组件协同工作,在多种任务和模型上提升性能,为通用Agent训练开辟新路径。
只训练数学,却在物理化学生物战胜o1!新强化学习算法带来显著性能提升,还缓解训练崩溃问题
上海创智学院、上海AI Lab的MM - Eureka系列工作提出新强化学习算法CPGD,缓解训练崩溃问题,提升性能。还构建多模态强化学习框架,推出MMK12数据集和MM - PRM模型,开源相关成果。
Thinking Machines发布首个产品Tinker :大模型后训练彻底变天
OpenAI前CTO Mira Murati的Thinking Machines公司发布首个产品Tinker,这是为微调大模型设计的灵活API,能简化LLM后训练过程,让用户专注算法和数据,平台处理分布式训练。它有多种特性,已被顶尖机构采用。
从混沌到可控:企业应用中AI Agent不确定性控制的 10 种策略
大语言模型输出的不确定性限制了AI智能体在企业场景的应用,本文总结控制生成式AI Agent不确定性的常见策略,涉及技术、应用设计、管理与治理层面,还推荐了相关作品。
图解Vllm V1系列5:调度器策略(Scheduler)
本文是图解Vllm V1系列5,聚焦调度器策略。先回顾vllm v1整体运作流程,接着阐述调度 - 推理的整体流程,包括将请求添加进Scheduler、Scheduler单步调度策略等,还对比了不同场景下的函数及调度逻辑。
ICML 2025 | 无需训练,即时对齐大模型偏好
上海人工智能实验室提出TPO方案,可让大模型在推理时快速对齐人类偏好,无需更新模型权重。TPO类似文本形式的梯度下降,在多个基准数据集评测中表现出色,还提供“宽深结合”推理拓展策略。
VeRL-Omni:面向扩散和全模态生成模型的通用RL后训练框架
VeRL-Omni是面向多模态生成模型的通用RL后训练框架,覆盖多种架构。它有高效多模态rollout、灵活奖励引擎等特性,支持多种硬件,团队还验证了不同训练方式,后续将扩展模型与算法支持。
Hugging Face开源nanoVLM,750行代码可训练视觉语言模型,简单到令人发指!
Hugging Face开源全新视觉语言模型框架nanoVLM,仅750行代码就能从零训练高效能VLM模型。它在单张H100 GPU训练6小时后,在MMStar数据集准确率达35.3%,且能在免费Google Colab跑。