参数高效微调」共找到 1419 篇相关文章

开源动态8

大模型开发者必读!拆解世界级AI模型的诞生,Hugging Face把4年模型训练经验写成了一本开源指南

Hugging Face发布《The Smol Training Playbook》,分享约4年构建SOTA模型和数据集的经验。手册涵盖是否训练、训练何种模型、如何训练等内容,强调数据质量重要性,还介绍了模型设计、训练中的实践与教训。

AIGC开放社区
算法论文7

全球强化学习+VLA范式,PI*0.6背后都有这家中国公司技术伏笔

机器之心介绍了Physical Intelligence成果π*0.6论文,指出VLA+online RL是有前景的研究方向。还分析VLA+RL重要性、应用难点,重点介绍星动纪元iRe-VLA突破困境的方案及其实验效果,揭示VLA在线强化学习前景。

机器之心
算法论文8

破解MoE模型“规模越大,效率越低”困境!中科院自动化所提出新框架

大模型参数量飙升却陷入‘规模越大,效率越低’困境,中科院自动化所研究团队提出统一框架,直击MoE底层运作模式,让专家‘组队学习’,实现参数量、负载方差降低,达成三重优化。

量子位
算法论文8

性能提升11.74%!腾讯优图提出激励推理,专攻复杂指令

现有大语言模型处理复杂指令能力不足,腾讯优图研究团队提出激励推理方法。该方法能提升LLM处理复杂指令表现,在1.5B参数LLM上性能提升11.74%,媲美8B参数模型。

量子位
开源动态8

2026开年王炸模型MiroThinker 1.5实测:Google和GPT没做到的事,被它做到了

自媒体从业者实测开源模型MiroThinker 1.5,它不拼参数规模,注重去伪存真。在多场景测试中表现出色,如投资决策、内容查证等。其技术揭示大模型未来或在于外部交互,而非参数膨胀。

AI寒武纪
算法论文8

DeepMind 颠覆机器人学习范式:让机器像人一样 “自由成长”

谷歌DeepMind受大模型微调中强化学习阶段启发,提出面向机器人学的两阶段后训练方法,含监督微调与自我提升。实验显示该方法让机器人自主习得新技能、广泛泛化,但研究也存在标注成本高等局限。

AI科技评论
算法论文8

ACL'25最佳论文解读 | 大模型也会‘弹簧回弹’?揭秘 LLM 对齐的脆弱根源

本文分享 ACL 2025 最佳论文,指出预训练大模型存在‘抗对齐’的 Elasticity 现象,即对齐微调只是暂时拉伸,后续微调会让其迅速弹回预训练分布。研究量化该概念,用‘压缩理论’刻画对齐并实验验证。

PaperAgent
开源动态8

社区供稿丨以小博大!Nanbeige4-3B重磅开源:硬刚Qwen3,挑战小模型能力新高度

近年来大语言模型发展陷入‘参数军备竞赛’,成本高昂。Boss直聘南北阁实验室发布Nanbeige4 - 3B,仅30亿参数,在预训练和后训练阶段采用多种创新技术,在多方面媲美甚至超越大模型。

Hugging Face
开源动态8

以小博大!Nanbeige4-3B重磅开源:硬刚Qwen3,挑战小模型能力新高度

近年来大语言模型参数膨胀,成本升高,业界重注小语言模型。近日,Boss直聘南北阁大模型实验室发布仅30亿参数的Nanbeige4 - 3B,在多方面媲美甚至超越通义千问Qwen3系列模型,开源印证小模型潜力。

AIGC开放社区
开源动态7

AI办公斩杀线,一页文档多少钱

腾讯混元Hy4 preview正式发布并开源,参数770B,是开源阵营里参数最大的Apache 2.0模型。它能处理长文本,官方定位有软件工程、办公分析等四个方向。还分析了处理一页文档的成本,指出办公AI下半场重在‘读懂’。

CourseAI