「多模态指令数据合成」共找到 3383 篇相关文章
Jina 第4版:多模态向量检索,统一适配,挑战3大任务
Jina第4版基于Qwen2.5 - VL模型扩展,支持单向量和多向量输出。它经对比学习和任务特化训练,推理时可按需选LoRA适配器,能利用多模态处理能力优化不同任务性能。
SeePhys Pro:重新审视多模态物理推理中的视觉理解与训练收益
来自中山大学等的研究者提出SeePhys Pro,是面向多模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。
智源清华带来PAM,手物交互数据生成新SOTA | CVPR 2026
北京大学、清华等联合提出统一引擎PAM,能整合姿态、外观和运动。用户提供初始和目标姿态及物体几何形状,它就能生成逼真手物交互视频。其效果超现有方法,合成视频可用于数据增强。
从数据到决策:AI 驱动的 Quick BI 架构设计与实践
阿里云智能集团瓴羊高级技术专家王璟尧,介绍阿里云 Quick BI 从传统 BI 到 AI 驱动的智能 BI 的进化,解析领域大模型与 BI 引擎协同设计等技术权衡,为行业提供可复用技术范式。
GPT-5准确率不足40%!北大发布多模态、高难度化学基准SUPERChem
北大团队发布多模态、高难度化学基准SUPERChem,构建评估大语言模型化学推理能力新体系。测试显示,GPT - 5准确率仅38.5%,与低年级本科生相当,且模型在高阶推理有短板,该基准为模型优化指明方向。
谢赛宁、李飞飞、LeCun联手提出多模态LLM新范式,「空间超感知」登场
纽约大学助理教授谢赛宁与李飞飞、Yann LeCun 合作提出「Cambrian - S」,迈出视频空间超感知探索第一步。该研究引入 VSI - Super 基准,还提出预测性感知范式,在空间认知任务上有提升,相关论文值得视频多模态研究者参考。
工程师狂喜!Qwen3-VL 检索双雄效率翻倍
通义大模型开源Qwen3-VL-Embedding和Qwen3-VL-Reranker,解决多模态检索难题。两模型多模态全兼容,双塔+单塔协同提速,实用主义拉满,集成成本低,实战表现超预期。
The Batch: 906 | AI 巨头分担维基百科的成本
维基百科成立25周年,维基媒体基金会与Amazon、Meta等多家AI公司达成合作,推出Wikimedia Enterprise计划,允许合作方高速大规模访问数据。维基百科需资金支持,AI公司也需其数据训练模型。
用得越多、失业越快?GitHub 大改 Copilot 规则:默认拿个人代码训练 AI,还搬出 Anthropic 挡枪!
当地时间3月26日,GitHub宣布自4月24日起,Copilot Free、Pro和Pro+用户交互数据默认用于训练AI模型,Business和Enterprise用户除外。GitHub称需更多数据覆盖编码场景,但此举遭用户吐槽。
数据土壤,决胜 AI 下半场:一场关于企业 Data+AI 战略的炉边思辨
2026年初,Snowflake与InfoQ联合举办活动,汇聚多领域专家探讨Data+AI前沿。回顾2025年,大模型迭代、AI安全等带来认知突破;还围绕2026年十大战略命题思辨,如企业Data+AI平台挑战、开源闭源博弈等。