「分布偏移」共找到 77 篇相关文章
挺搞笑,MiniMax模型就是不认识「马嘉祺」
网友发现 MiniMax 模型不认识「马嘉祺」,不同接口和平台均能稳定复现。这或因训练数据清洗和分布问题,使特定词汇生成异常。论文指出 tokenizer 机制缺陷或致模型异常,问题不会随参数规模增大消失。
中国第一批没有论文的工科博士毕业了
国内推出实践型博士学位,不看论文,只认硬核实践产出。自去年9月以来,至少11人获此学位,分布多领域。这一制度由《学位法》推动,且清华创新领军工程博士如周鸿祎也适用。
SOP:具身智能在线进化新范式,为大规模真实世界部署而生
智元机器人具身研究中心提出SOP在线后训练系统,将VLA后训练重构为“在线、集群、并行”,可即插即用后训练算法。它有高效探索、缓解偏移等优势,实验显示能提升性能、效率,突破VLA瓶颈。
打破确定性魔咒!北航团队提出VBF++:用“不确定性建模”刷新多模态视频推荐 SOTA
北京航空航天大学和北京邮电大学联合提出VBF++框架,将多模态融合从“点估计”升级为“分布建模”。它由上下文感知先验、推荐引导的对抗优化和元学习三大组件构成,在多个数据集上刷新SOTA。
北大彭一杰教授课题组提出RiskPO,用风险度量优化重塑大模型后训练
北大彭一杰教授课题组提出 RiskPO,解决大模型后训练陷入「均值陷阱」问题。它将风险规避理念融入优化目标,用「关注奖励分布左尾」替代「追求整体均值」,在多领域数据集上表现超越 GRPO 等。
答对了却没看图?EASE给多模态RLVR装上「视线校正器」
强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。
爆火的腾讯WorkBuddy发了篇论文,公开了自家底牌
腾讯 WorkBuddy 团队将内部模型选型评测等开源成 Benchmark,公开多模型 Agent 工作台选型底牌。Bench 优点是任务分布真实且开源可审计,论文介绍了核心方法论、四大赛道拆解、榜单结果,还对比了现有工作。
ACL'25最佳论文解读 | 大模型也会‘弹簧回弹’?揭秘 LLM 对齐的脆弱根源
本文分享 ACL 2025 最佳论文,指出预训练大模型存在‘抗对齐’的 Elasticity 现象,即对齐微调只是暂时拉伸,后续微调会让其迅速弹回预训练分布。研究量化该概念,用‘压缩理论’刻画对齐并实验验证。
Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转
Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。
腾讯LLM团队:对下一个 Token 预测的深入剖析,多样性 or 精准度?
最新研究证实RL能增强LLM推理,但成效受限预训练token分布。腾讯LLM部把交叉熵重写成单步策略梯度,用超参压熵,为RL打造‘低熵高信号’起点,经实验验证低熵模型优势明显。