多模态微调」共找到 1187 篇相关文章

算法论文7

大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱

CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。

量子位
新闻资讯7

确认!DeepSeek多模态AI已经开测

DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。

量子位
算法论文8

告别微调!斯坦福提出Agentic上下文工程

当前微调大语言模型成本高、不灵活,‘上下文适应’方法有短板。斯坦福大学等提出ACE框架,将上下文变为动态‘战术手册’,解决现有问题。论文通过实验验证其在性能、成本和效率上优势,为大模型发展指明新方向。

深度学习自然语言处理
开源动态8

多模态Qwen3-VL-Embedding开源&技术剖析

互联网内容多元,传统文本搜索引擎应对跨模态需求力不从心。阿里开源Qwen3-VL系列两大模型,Qwen3-VL-Embedding负责“海选”,Qwen3-VL-Reranker负责“决赛”,技术亮点多,实验表现优异。

PaperAgent
产品应用7

Thinking Machines 发布 Tinker API,实现灵活的模型微调

Thinking Machines公司发布Tinker API用于开放权重语言模型微调,可减少开发者基础设施开销。支持多种模型架构,集成LoRA,还发布开源存储库。虽有竞品,但Tinker侧重暴露低级原语,尚处封闭测试。

AI前线
算法论文8

MoCa:首个大规模双向多模态表征模型

为解决VLM用于嵌入的痛点,中国人民大学等机构研究者提出MoCa框架,可将单向注意力VLM训练成双向多模态编码器。它分两阶段,实验效果好,未来可拓展模态、提升多语言适应等。

PaperAgent
算法论文8

视觉感知RAG × 多模态推理 × 强化学习 = VRAG-RL

数字化时代视觉信息愈发重要,传统RAG方法处理视觉信息面临挑战。阿里巴巴通义实验室的VRAG - RL将强化学习引入多模态智能体训练,革新检索生成范式,提升视觉语言模型多方面能力,代码已开源。

PaperAgent
算法论文7

清华-腾讯联手:音频 - 视觉多模态任务统一框架

Crab是人大、清华和腾讯合作论文提出的模型,目标是高效一统多模态场景理解任务。它解决了音频 - 视觉理解模型任务干扰、合作显式化不足等难点,通过构建数据集、设计结构和统一架构实现多任务合作。

CourseAI
产品应用7

Thinking Machines 发布 Tinker,重新定义 LLM 微调的边界

Thinking Machines 发布工具 Tinker,它是灵活的语言模型微调 API,采用‘责任分工’模式,让研究者专注算法创新,不用被运维细节拖累。此模式获 Karpathy 赞赏,目前 Tinker 开始内测,理念受欢迎。

AI工程化
算法论文8

微调重要表征以增强思维链的推理能力

团队提出关键表征微调(CRFT)方法,通过信息流分析识别和优化关键表征。在八个数学和常识推理基准及两个模型系列验证其有效性,能提高推理准确率,学习参数量低,还适应少样本场景。

深度学习自然语言处理