多模态数据集」共找到 3285 篇相关文章

开源动态8

马斯克开源新模型:能实时抓取社交平台数据,20万块H100训练

马斯克旗下xAI开源去年最佳模型Grok - 2.5,6个月内还将开源旗舰模型Grok 3。Grok - 2.5可实时抓取社交平台X数据,用超20万块H100训练,性能超GPT - 4o等,应用场景广泛。

AIGC开放社区
开源动态8

一键式训练端到端Agent,Qwen3+MCP工具高效成!

RLFactory是开源的端到端RL后训练框架,将环境与训练解耦,用Qwen3基座调用MCP工具,可低代码训练端到端Agent模型。它极致易用、训练高效,还支持一键式训练,未来会更易用高效。

深度学习自然语言处理
算法论文8

理解帮助生成?RecA自监督训练让统一多模态模型直升SOTA

统一多模态模型在视觉理解和生成能力上不平衡,常理解强但生成弱。本文提出重建对齐(RecA)自监督后训练方法,不改动架构,用未标注图像训练,在多模型实验中提升性能,部分达SOTA。

机器之心
产品应用7

Pinterest 利用内容指纹技术,在数百万个域名中实现 URL 去重

Pinterest工程师开发“最小重要查询参数”(MIQPS)URL标准化系统,用于优化大规模数据管道内容去重。它取代传统方法,用数据驱动判断参数重要性,还采用早期退出逻辑等提高效率。

InfoQ
产品应用7

CSD7Z020 + CSD9361:从射频到基带,构建完整SDR数据通路

成都华微以CSD7Z020异构SoC搭配CSD9361宽带射频收发器搭建SDR硬件平台,打通从射频到应用层的数据通路,有灵活可编程、高成度等优势,适用于多种场景。

芯师爷
8

企业数据“LLM ready”与“小Palantir”们的崛起 | AGIX PM Notes

文章指出当前 AI 仍处准备阶段,企业数据未就绪是落地大障碍,深层问题是流程 AI 原生化转型。还介绍本周市场、多家科技企业动态,以及巴菲特和芒格对 ETF 的看法及投资建议。

海外独角兽
算法论文8

SFT在帮倒忙?新研究:直接进行强化学习,模型多模态推理上限更高

学界常用「监督微调(SFT)+ 强化学习(RL)」训练大模型。但新研究发现,SFT 会引发「伪推理路径」,阻碍推理进步。相比之下,直接进行 RL 训练,模型多模态推理上限更高,该团队训练的模型还刷新了纪录。

机器之心
算法论文8

高潮从第几秒开始?GaMMA 让多模态大模型真正「听懂」音乐时间线

现有多模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在多基准上表现优异,刷新 SOTA。

机器之心
开源动态8

代码、多模态检索全面登顶SOTA!智源BGE向量模型三连击,并全面开放

检索增强技术在代码及多模态场景作用大,向量模型是关键。智源研究院联合高校研发三款向量模型BGE - Code - v1、BGE - VL - v1.5、BGE - VL - Screenshot,登顶多领域测试基准,已全面开放助力研究与应用。

机器之心
算法论文8

ACL'25 | CIGEval:一种基于多模态大模型的可控生图评测智能体

阿里国际AI团队提出CIGEval,这是基于多模态大模型驱动的图像生成评估智能体框架。它成多功能工具箱,通过任务拆解与工具调度提升评估准确性与可解释性,已在ComfyUI - Copilot上线。

PaperAgent