少样本训练」共找到 2451 篇相关文章

算法论文8

冷门新语言AI写不动?IEEE论文:从零到及格线,MoonBit给出完整训练路线

IEEE论文聚焦新语言MoonBit和Gleam,探讨大模型代码生成能力。研究发现大模型零样本生成新语言代码能力差,few - shot和RAG有提升但有限,继续预训练及指令迁移可显著提高模型表现。

量子位
算法论文8

多模态模型学会“按需搜索”,搜30%还更准!字节&NTU新研究优化多模态模型搜索策略

字节与NTU优化多模态模型搜索策略,通过搭建工具、构建数据集及设奖励机制,用强化学习训练模型,使其按需搜索。实验显示,MMSearch - R1系统搜30%还更准,为多模态大模型发展提供洞见。

量子位
算法论文8

别再卷数据了,LLM也怕「过劳死」!CMU等揭秘灾难性过度训练

CMU、斯坦福等四大名校研究团队挑战“预训练规模越大越好”观点,提出“灾难性过度训练”现象,即增加预训练数据可能导致后训练性能下降,并从现实证据、控制实验、理论分析等方面阐述新研究贡献,还介绍了相关实验及结论。

新智元
开源动态8

一键式训练端到端Agent,Qwen3+MCP工具集高效集成!

RLFactory是开源的端到端RL后训练框架,将环境与训练解耦,用Qwen3基座调用MCP工具集,可低代码训练端到端Agent模型。它极致易用、训练高效,还支持一键式训练,未来会更易用高效。

深度学习自然语言处理
算法论文7

MOE RL实战:统一FP8全流程训练

SGLang RL团队等联合完成工作,实现RL中全流程FP8训练与采样。介绍FP8训练硬件基础、格式、scale选择等,指出训练难点,分析KL Loss异常归因,验证其在MoE模型RL应用效果,还探究模型规模对训推不一致性的影响。

GiantPandaLLM
开源动态8

模型、代码、数据全开源!轻松训练自己的垂类Agent!

Together AI联合Agentica推出`DeepSWE-Preview`,基于开源Qwen模型,用RL在SWE - Bench - Verified登顶。团队将模型权重、训练框架等全开源,抛弃SFT纯用RL训练,还分享训练秘籍和TTS技巧,为垂类Agent训练提供新范本。

探索AGI
算法论文8

AMD新论文颠覆认知:FP4训练不稳定,原因不是随机性不足

大模型训练成本高,降低训练精度可降成本。AMD联合宾州州立大学论文颠覆认知,揭示FP4训练不稳定源于结构性微缩放误差,非随机性不足,还在原生FP4硬件完成大模型预训练

机器之心
产品应用8

一个月的活一周干完!英伟达世界模型训练速度飙升400%

英伟达世界动作模型 DreamZero 训练成本高、耗时长,无问芯穹与清华等推出的 RLinf 框架,从算子融合到 I/O 全链路系统级重构,使训练吞吐拉高近 4 倍,还解决多类性能瓶颈,保证训练效果。

新智元
开源动态8

训练即服务!让模型训练回归算法语义,150行代码跑通RL

ModelScope团队开源Twinkle框架,采用Client - Server架构,支持20余种算法组件。开发者约150行代码就能编排复杂RL训练循环,底层调度等交给框架。它兼顾易用性与灵活性,有多种特点和优势,代码已开源。

量子位
算法论文8

多轮Agent蒸馏终于不翻车!港中文x通义新方法成功率暴涨18点,训练还快32%

香港中文大学联合阿里通义事业群提出TCOD训练方法,解决多轮Agent蒸馏稳定性难题。它只需对现有OPD代码做极改动,提升了模型成功率,压缩行动步数,还减训练时间,未来或成训练长程Agent标配。

量子位