「训练方法升级」共找到 4024 篇相关文章
刚刚,Claude 5.1 发布!全球最强模型来了
Anthropic推出Claude Fable 5.1和Claude Mythos 5.1。Fable 5.1面向普通用户等,Mythos 5.1面向高风险领域伙伴。Fable 5.1性能优、价格低,在多测试中表现提升,还能用于科研,且安全防护机制升级。
斯坦福英伟达推出测试时强化学习:微调开源模型胜过顶级闭源模型,仅需几百美元
斯坦福、英伟达等提出TTT - Discover方法,基于开源模型gpt - oss - 120b,在测试阶段引入强化学习更新模型权重。它采用熵目标函数和PUCT启发机制,解决分布外问题,成本低且表现优,但目前适用于连续奖励场景。
2026,一篇不错的高效Agents技术全面综述
上海AI Lab等9所高校联合发表《迈向高效智能体(Agents):记忆、工具学习与规划综述》。文章介绍了高效智能体概念,分析其效率危机,阐述提升效率的三大战略方向,涵盖多种记忆、工具学习和规划方法。
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。
超94%类别第一!3D点云异常检测与修复新SOTA | ICCV'25
3D点云异常检测在制造等领域重要,但传统方法有丢细节、难修复问题。上海科大与密歇根大学团队提出PASDF框架,借助相关技术达成检测修复一体化,实验显示精准稳定,在两大基准上成绩优异。
抖音&LV-NUS开源多模态新模,以小博大刷新SOTA,8B推理比肩GPT-4o
抖音SAIL团队与LV - NUS Lab联合推出多模态大模型SAIL - VL2,以中小参数规模在106个数据集实现性能突破。该模型从架构、数据、训练三方面创新,后经全链路优化,在多数据集验证中表现卓越。
英伟达韩松团队新作:具有后神经架构搜索的高效语言模型
英伟达韩松团队推出基于后神经架构搜索的高效语言模型Jet - Nemotron,在基准测试中表现出色,准确率与Qwen3等相当甚至更优,生成吞吐量大幅加速。模型构建经多步骤优化,代码和预训练模型将开源。
逆强化学习全新视角的大模型对齐技术
文章从逆强化学习(IRL)视角回顾LLM对齐进展。先介绍强化学习基础及挑战,将LLM生成过程化为MDP,探讨无奖励函数的MDP,说明需神经奖励模型,还阐述通过奖励建模实现IRL及多种优化方法。
VLA统一架构新突破:自回归世界模型引领具身智能
北京智源研究院联合中科院自动化所提出 UniVLA 全新 VLA 模型架构,基于全离散、自回归机制建模多模态信号,后训练引入世界模型。它刷新多项基准纪录,在真机操控和自动驾驶有潜力,为多模态感知决策融合带来新思路。
上班后重新开始练口语,并获得了价值感
作者分享上班后用AI练口语的经历,称能无痛坚持,还获得价值感。介绍了AI练口语比线上外教课的优势,如免费、时间灵活等,也分享利用AI练口语的方法,如选话题、当场学习等。