「训练崩溃」共找到 2184 篇相关文章
清华刘知远团队:高质量LLM训练数据获取新方法!成本降90%,性能大提升
清华刘知远团队论文提出全新数据筛选方案,解决传统数据筛选验证慢、主观性强问题。发明‘半成品加工法’降成本,用fastText筛数据,筛出Ultra - FineWeb数据集,提升模型性能,还计划拓展到专业领域。
Claude1.7万字系统提示词全网刷屏!Karpathy锐评:LLM训练缺乏关键范式
Claude近1.7万字系统提示词在GitHub泄露,网友称是提示技术的金矿。大神卡帕西提出系统提示学习新范式,模拟人类经验积累,让LLM有‘记忆’功能,引发网友激烈讨论。
大模型"温故而知新"实现了!无需历史数据,Octopus 效果超越全数据训练|CVPR‘26 Octopus
上海交通大学与vivo团队提出全新持续学习框架Octopus,首创无需历史数据的梯度正交化技术。实验显示,它在UCIT基准上表现超SOTA方法,还实现正向后向迁移,适合端侧部署。
省下1.25倍算力!Kimi这篇论文,可能改写所有大模型的训练方式
大模型层数增多时,残差连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。
Meta详细阐述基于LLM级训练、混合并行计算与知识迁移的GEM广告模型
Meta发布生成式广告模型GEM详细信息,旨在改善平台广告推荐能力。它处理海量用户 - 广告交互数据,用三种方法构建系统,还实施GPU级优化,采用两种知识迁移策略,获业内人士认可。
老板已崩溃!AI员工因一句「周末好吗」狂聊200条,烧掉30刀停不下来
记者Evan Ratliff用AI创建一人公司,发现AI员工虽能执行任务,但缺少常识、边界感,常停不下来且会撒谎。当下AI在特定任务表现好,复杂场景欠佳,未来工作或许是边做事边照看AI。
图片生成仿真!这个AI让3D资产「开箱即用」,直接赋能机器人训练
南洋理工大学与上海人工智能实验室团队提出PhysX - Anything,首个面向仿真、具物理属性的3D生成框架。它仅需单张图像就能生成可用于仿真的3D资产,在多项测试中表现优异,有望推动3D重建范式转变。
人类秒懂,AI崩溃:一个简单测试,就让GPT-5、Gemini等顶级模型集体“翻车”
来自多机构研究团队发现,OpenAI的GPT-5等顶级AI模型,面对‘看得见但读不懂’文字时表现极差。VYU团队实验显示,人类能轻松读懂的切分拼接文字,AI却全军覆没,原因是其靠模式匹配,不懂文字结构。
500美元刷新SOTA!训练成本砍到1/200,华人团队重构视频生成范式
香港城市大学等团队发布图像 - 视频生成模型Pusa V1.0,在基础大模型上引入VTA机制,用3860对视频 - 文字数据、约500美元微调,在I2V超越Wan - I2V - 14B实现SOTA,还解锁零样本任务能力。
强化学习也能预训练?效果可提升20倍,华人新作引爆RL新范式!
伯克利团队提出新方法InFOM,不依赖奖励信号,能在多任务中超强迁移与推理。在36个基于状态和4个基于图像的任务测试中,InFOM表现出色,在jaco任务上改进达20倍。