「两阶段微调」共找到 1551 篇相关文章
别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」
浙大陈静远教授课题组等提出自适应非对称适配器,放弃对图像分支硬性微调,引入预测置信度自动给视觉塔‘踩刹车’。经实验总结出微调三大核心洞察,在多个数据集测试中表现优异。
微调已死?Google 和斯坦福论文指出AI 学习新范式
Google的ReasoningBank和斯坦福的ACE两篇新论文引发热议,二者都在解决让AI系统真正学会学习的问题。前者是经验管理系统,后者让输入上下文进化,都绕开微调探索AI持续学习与自我改进能力。
Unsloth-MLX:在Mac上微调LLM,代码无缝迁移到云端GPU
对于Mac用户,在原型实验阶段反复租云端GPU是资源浪费。开发者推出Unsloth - MLX,基于MLX框架,让Mac用户本地高效微调大模型,改一行导入语句就能无缝迁移代码到云端,还介绍项目特点、状态等。
AI泡沫后只剩这两类公司杀出重围!昆仑万维CEO方汉:明年唯一技术赛点在Agent
昆仑万维CEO方汉认为,AI泡沫是必经阶段,产品价值落地成主线,生态是系统工程。今年两类公司突围,四类公司落后。2026年技术赛点是Agent自动化‘可验证过程’。
Claude团队用Qwen测试全新训练方法
Anthropic最新研究提出中训练(MSM),在预训练后、后训练前给AI立规矩。实验显示,新增MSM能让通义千问两款32B大模型失准率大幅下降,还能精简微调数据。MSM与对齐微调结合,可提升模型泛化能力。
开源即屠榜!UniME多模态框架登顶MMEB全球训练榜,刷新多项SOTA纪录
格灵深瞳等团队联合发布通用多模态嵌入新框架UniME,刷新MMEB训练榜纪录。它是两阶段框架,经文本判别知识蒸馏和困难负样本增强指令微调,在多任务达SOTA,项目已开源。
2篇最新Anthropic论文,揭开LLM对齐新范式
Anthropic在5月连发两篇研究,揭示LLM对齐训练新范式。指出单纯模仿正确行为不足以保证安全,需在预训练与对齐微调间插入教原理阶段。研究围绕Claude模型展开,有多项关键发现,MSM方法效果显著。
Murati翁荔陈丹琦公司发布首个产品,让大模型微调门槛暴降,要重新发明一个OpenAI
Thinking Machines Lab发布首个产品Thinker,让模型微调像改Python代码一样简单。它是用于微调语言模型的灵活API,降低了大模型微调门槛,受到业界关注。此外,该公司还尝试重新发明OpenAI,而OpenAI正打造社交模式。
充分激发模态协作,MokA量身打造MLLM微调新范式
当下多模态大模型微调多「照搬」单模态微调策略,忽视模态差异。中国人民大学和上海人工智能实验室团队提出 MokA 方法,兼顾单模态与跨模态建模,在多基座、多场景实验中显著提升性能。
Meta这两篇最新Agent Learning论文,有些意思!
分享Meta SuperLabs两篇Agent Learning论文,从‘如何低成本获得高质量经验’出发,形成技术链,为语言智能体进入‘规模化RL时代’提供路线图,还分析了Agent RL问题及两论文成果、对比。