「SFT训练集」共找到 2530 篇相关文章
Sea AI Lab 揭秘:你费尽心力调的 LLM 一直在崩溃?罪魁祸首可能只是一个参数:BF16
Sea AI Lab 和新加坡国立大学研究指出,强化学习微调中训练不稳定和性能瓶颈,根源是数值精度 BF16。其低精度造成“训练 - 推理不匹配”,使训练易失败。将精度切换到 FP16 可解决问题,提升模型表现。
OpenAI没做到,DeepSeek搞定了!开源引爆推理革命
文章围绕大语言模型推理能力展开,介绍了推理模型概念,回顾RLHF训练流程,对比OpenAI的PPO和DeepSeek的GRPO,还阐述了GRPO开源升级版DAPO的关键技术点及训练中模型的新能力。
阿里+清华发现80/20法则:LLM只靠20%的token就能学会Reasoning
阿里与清华研究发现,训练大语言模型(LLM)推理时,真正关键的是20%的高熵token,其余80%低熵token几乎无用。仅用20%高熵token做强化学习,效果超全量训练,还提出RLVR训练策略提升效率。
Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制
论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。
AI产业链投资大逻辑:第三集
本集围绕AI产业链投资大逻辑,从底层的电展开。指出AI瓶颈正从GPU扩散到电力,存量核电资产因AI数据中心需求变得值钱,还引出'过渡期与终局'核心判断框架。
AI产业链投资大逻辑:第五集
本集围绕AI产业链算力服务层中云的故事展开,探讨在AWS等超大规模云厂商主导市场下,为何还会冒出新型AI云公司且获高估值。过去十五年云计算市场由巨头主导,2023年后,其自身算力不足使市场结构出现裂缝。
美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练
美团和浙大联合推出GUIRoboTron - Speech,这是首个能利用语音指令和屏幕截图端到端决策的自主GUI智能体。它解决了文本依赖问题,团队经多步骤研发,其性能评估表现佳,还给出招聘信息。
第二代AI预训练范式:预测下个物理状态
英伟达科学家 Jim Fan 发布《第二代预训练范式》,指出当前以 LLM 为代表的第一代范式应用于物理世界时「水土不服」,认为第二代范式是「预测下一个物理状态」,引发机器学习社区讨论。
利用大模型检测钓鱼邮件:方法,效果及数据集
随着企业安全防范增强,钓鱼邮件成重要攻击手段,大模型检测方法盛行。日本论文详细披露检测方法和实验数据,含解析解码、简化邮件、生成prompt、调用LLM四步,还介绍数据集及评估了四个模型效果。
训练机器人方式对了吗?英伟达DreamZero双榜第一新反思
NVIDIA的DreamZero在RoboArena和MolmoSpaces基准测试双登顶。分析文章《Why is DreamZero so good at robotics?》从多维度拆解其表现突出原因,质疑传统认知,如数据量并非万能,模型规模和信息输入方式也很关键。