「多模态LLM」共找到 1854 篇相关文章
Open Responses 规范实现智能体式 LLM 工作流的统一
OpenAI发布Open Responses开放规范,获Hugging Face等支持,为智能体式AI工作流制定统一标准,减少API碎片化,支持多模态输入等,引发行业对厂商锁定和生态成熟度的讨论。
从多模态大模型中「拆」出音频向量模型
Google 发布原生多模态向量模型 Gemini Embedding 2,推动 Omni Embedding 发展。Jina AI 团队分享从多模态大模型中「拆」出音频向量模型的经验,介绍架构、训练数据,对比四种做法,还提及评测、应用场景及结论。
关键技术详解|腾讯一念 LLM 分布式推理优化实践
InfoQ 邀请袁镱分享《一念 LLM 分布式推理优化实践》。介绍了“一念 LLM”设计思路、推理优化挑战与突破等,还对比不同框架,指出优化方向,如先实现 PP,再推进 EP 与 PD 分离。
ETT:打破原生多模态学习视觉瓶颈,重塑视觉tokenizer优化范式
本文由多机构联合完成,针对传统视觉 tokenization 方法优化与下游任务训练割裂问题,提出 ETT 调优方法。它实现联合优化,在多模态理解、生成、重构任务表现出色,虽有局限但带来新突破。
刚刚,OpenAI前CTO:战胜LLM不确定性的方法找到了!
OpenAI前CTO创立的Thinking Machines Lab发布研究《战胜LLM推理中的不确定性》。研究指出LLM推理不确定性主因是批处理大小变化,而非常见认为的GPU并行性等。还给出实现批处理不变性的方案及实验结果。
“心内推理”:一种动态多模态潜在空间推理范式 | 直播预约
当前多模态大模型推理效率低、稳定性不足。本次分享将介绍DMLR,它无需额外训练,仅在推理阶段生效,通过在潜空间优化潜在思考token、引入关键视觉信息,实现高效稳定的多模态推理。
构建 AI 时代的知识底座:直播数据 LLM Wiki 实践
文章围绕直播数据 LLM Wiki 实践展开,指出领域知识沉淀面临挑战,引出 LLM Wiki。介绍其实际效果,如指标召回、代码生成等,阐述构建方法、架构设计、编译流水线、检索方式,还提及增量编译与持续 Lint,最后给出未来规划。
刚刚,DeepSeek多模态技术范式公布,以视觉原语思考
DeepSeek发布多模态模型并公布技术报告,提出‘以视觉原语思考’。该模型解决多模态大模型‘指代鸿沟’问题,有把坐标变思维单元、7056倍视觉压缩、精心设计冷启动数据等创新,实验在多任务上超主流模型。
RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈
大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。
多模态 +Agent 在培训与教育领域的应用|QCon 北京
4月16 - 18日,QCon全球软件开发大会将在北京举办,聚焦Agentic AI等前沿话题。北银金科尹辰轩将分享《多模态 + Agent在培训与教育领域的应用》,探讨多模态模型推动AI场景扩充等内容。