「两阶段监督微调」共找到 1090 篇相关文章
告别复杂提示词!蚂蚁新方式让AI自动理解你的个性化需求
蚂蚁通用人工智能研究中心自然语言处理实验室提出AlignXplore方法,通过强化学习让AI从用户行为归纳偏好并动态更新。该方法训练分两阶段,支持流式偏好推断,实验表现优异,是大模型个性化新尝试。
字节跳动开源文档解析大模型Dolphin,告别繁琐的文档处理,上线狂揽1k星,真是绝了!
字节跳动开源文档解析大模型Dolphin,采用两阶段分析 - 解析范式,有异构锚点提示等功能,适用多领域。技术架构基于视觉 - 编码器 - 解码器,训练集超3000万个样本,安装推理简单,比同类更具竞争力。
ICML 2026 | 突破3DGS光度多义性瓶颈:北航/新国立提出AmbiSuR,重塑高保真3D几何重建
3D高斯泼溅推动神经渲染发展,但提取3D几何表面易失真,核心瓶颈是光度多义性。北航与新国大团队提出AmbiSuR框架,从表征和监督层面解决问题,实验证明其在多数据集表现优异。
数据邪修大法好:仅用文本数据就能预训练多模态大模型
多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。
全景视觉的Depth Anything来了!Insta360推出DAP,200万数据打造全场景360°空间智能新高度
Insta360等团队推出全景度量深度基础模型DAP,构建200万量级全景数据引擎,设计三阶段伪标签管线,在模型架构上也有创新,在多项测试中效果优异,项目代码与模型已开源。
RL 是新的 Fine-Tuning
今年 9 月,Thinking Machines 研究使 LoRA 重获重视。OpenPipe 创始人 Kyle Corbitt 访谈指出,多数场景微调 ROI 低,RL 将融入 agent 生命周期成主流,但 RL 落地难在环境搭建,World Model 或为关键。
AI模型守法率提升11%,港科大首次用法案构建安全benchmark
香港科技大学KnowComp实验室从法律合规视角研究LLM安全,提出「安全合规」新范式。基于法律条文构建benchmark,用GRPO微调Qwen3 - 8B得推理模型,在新benchmark测试中性能提升显著。
从第一性原理出发的RAG推理新范式来了,蚂蚁DIVER登顶权威基准
当前RAG系统处理多步逻辑推理任务有局限,蚂蚁集团团队提出DIVER框架解决推理密集型检索难题。它将检索任务分四阶段,在BRIGHT榜单领先,行业对比优势明显,医疗应用效果好。
ParScale:一种全新的大模型Scaling Law
文章提出并行扩展(ParScale)路线,在不增模型参数下,通过引入并行流提升性能。新扩展定律打破传统范式,两阶段后训练策略降成本,还适用于边缘设备,研究仍在进行。
Skills火爆之后,我收集并整理了最近全网火爆的Skills,拿走不谢~~~
文章介绍 Agent Skills,称其是 AI 助理的「使用指南」,技能分浏览、加载、使用三阶段加载,有快且轻、跨平台、易分享等优势。还推荐多个优秀 skills 及相关工具网站,提醒从业务出发看待它。