「多模态嵌入模型」共找到 7955 篇相关文章
强化学习新发现:无需数学样本,仅游戏训练AI推理大增
莱斯大学、约翰斯・霍普金斯大学和英伟达研究团队有颠覆性发现,让多模态大语言模型玩简单游戏,无需数学样本,就能显著提升其多模态推理能力。提出的ViGaL方法在多个基准测试中表现出色。
ICML 2026 | 大模型内部也会长出「情绪树」,规模越大越懂人心
ICML2026 论文指出,大语言模型内部会自然形成类似人类心理学模型的「情绪树」,模型越大,情绪树越复杂,且在销售等任务上表现更好。同时,模型的情绪结构受身份设定影响,存在与人类相似的情绪识别偏见。
终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成
过去两年视频生成模型不断提升画面参数,但传统模型生成的视频固定,用户无法干预。而世界模型可跟随操作实时渲染、动态生成世界。目前Noiz AI联合多机构发布实时可交互音视频世界模型HelixWorld 1.0,后续还将开源。
从“一句成片”到“长轨推演”:探究多模态智能体在长视频编辑中的应用
近年来大语言模型在长篇视觉叙事中潜力卓越,但长视频剪辑仍难控制。中科大等团队开源工作从系统工程视角研究多模态智能体在长视频编辑中的机制,重构剪辑管线,找到症结并给出解决办法。
Qwen3.6-27B 开源:小小身材,超级码力
阿里云宣布开源 Qwen3.6-27B 多模态模型,支持多模态思考与非思考模式,在智能体编程方面超前代旗舰 Qwen3.5-397B-A17B。它已在 Qwen Studio 上线,开源权重可从 Hugging Face 和 ModelScope 下载,阿里云百炼 API 即将支持。
不上云、不租卡,如何优雅地在本地微调Qwen-VL-30B?
文章指出企业训练多模态助手,30B 参数的开源多模态模型如 Qwen-VL-30B 是不错选择,但多模态场景下显存需求大。联想 ThinkStation PGX 解决了显存难题,还介绍其性能、优势、适用场景及服务等。
GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”
智源研究院发布国产开源统一图像生成模型OmniGen 2.0版本。它增强理解与生成能力,打通多模态生态。玩法简单,技术有创新,还引入反思机制和新基准,推理效率提升,且将全面开源。
DeepSeek睁开眼了!Opus-4.8的性能,1000张图不到20美分
DeepSeek首个多模态视觉模型deepseek-v4-flash-vision-exp上线DeepSeek API平台。文本能力与V4-Flash持平,多模态Agent能力逼近Opus-4.8,分析1000张图成本不到20美分,还上线免费Files API。
如何将LLM的"思考习惯"迁移到视觉领域?
传统多模态模型处理复杂视觉推理能力不足,OVR团队以Qwen2.5 - VL - 7B为基础构建开源强化学习框架,成果模型OVR在12个基准测试刷新记录,揭示认知行为跨模态迁移三条黄金定律。
准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用
近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。