三阶段流水线」共找到 1567 篇相关文章

算法论文8

让大模型学会「自己教自己」!京东&中科院信工所连发篇论文定义Self-Taught RLVR

京东和中科院信工所开展Self - Taught RLVR系列研究,连发篇论文。从RLSD、NPO、CoPD个维度探索让大模型自我指导。如RLSD解决信息泄漏,NPO引入有效学习信号,CoPD整合多专家能力,各有创新与良好效果。

量子位
新闻资讯7

Agent 不是渐进升级,而是要“换代”了:Cursor 工程负责人放话未来到六个月,行业将迎来大变局

本文是对Cursor工程负责人Jason Ginsberg的访谈。他认为编码Agent正换代,未来到六个月行业将大变,会接管复杂任务。还谈及编码Agent发展、Cursor使用方式、交互模式等,分享了产品开发、审查等看法。

InfoQ
产品应用8

24小时直播,只靠一张照片?虎牙实时多模态数字人VAM 1.0率先突围行业堵墙

虎牙推出实时多模态数字人VAM 1.0,只需一张照片就能转化成能说会唱、可实时互动的数字人。它解决了AI数字人行业的时间、交互、部署堵墙,稳定性、交互精度和响应速度表现出色,应用场景广泛。

量子位
新闻资讯8

王小川:医疗行业对大模型有大刚性要求,但通用模型一条都不达标

5月22日百川智能展示医疗大模型Baichuan - M4与AI家庭医生「百小医」。王小川指出通用大模型用于医疗有问题,医疗对大模型有低幻觉、强循证、会提问的刚性要求,而通用模型不达标。Baichuan - M4表现出色,百小医也有独特定位和优势,且与家顶尖医院合作成果显著。

Founder Park
算法论文8

SRO赋能Qwen-2.5-VL推理性能飙升16.8%

文本领域推理模型成就大,但多模态大型语言模型推理能力扩展遇阻,如冷启动初始化不足等。提出SRO阶段训练框架,经测试,ReVisual - R1平均性能提升16.8%。

CourseAI
算法论文7

SRO架构赋予Qwen-2.5-VL推理能力,性能飙升16.8%

文本领域推理模型成就大,但扩展到多模态大语言模型遇阻力,如冷启动初始化不足等。为此提出 SRO 阶段训练框架,经测试,ReVisual - R1 平均性能提升 16.8 个百分点。

CourseAI
算法论文8

细粒度视觉推理链引入数学领域,准确率暴涨32%,港中文MMLab打破多模态数学推理瓶颈

香港中文大学MMLab团队发布MINT - CoT视觉推理方案,解决多模态数学推理难题。它引入特殊Interleave Token,构建专属数据集,采用阶段训练策略,实验效果全面超越现有方法。

量子位
算法论文7

告别Reasoning模型的“灵光一现”,推理能力可控了

当前GPT - 4o、DeepSeek - R1等大模型推理的‘高级操作’随机触发,不可控。研究者受经典推理要素启发,教会模型种‘元能力’,经阶段训练,模型效果提升,让推理能力可控。

深度学习自然语言处理
产品应用8

每一幕皆可控!字节发布多主体视频生成神器,人人皆主角

字节发布多主体视频生成神器MAGREF,基于一张参考图像,能生成主体高度一致的视频,多人同台也不串脸。它采用阶段数据处理流程,构建在DiT架构上,实现复杂视频生成任务。

量子位
开源动态8

阿里开源SmartResume,简历解析无需手工

阿里在Hugging Face和ModelScope上开源智能简历解析系统SmartResume,能将多种格式简历转为结构化数据,分阶段工作,性能优于基线方法,为HR和开发者提供工具。

AI工程化