「多模态架构」共找到 2582 篇相关文章
对话鹿明CTO丁琰:数据会反向决定模型,甚至影响硬件形态 | GAIR 2025
本文是对鹿明CTO丁琰的访谈。丁琰博士最早将UMI落地实践,其数采方案「FastUMI」受青睐。他认为UMI是完整体系,数据会反向影响多方面。还对比多种数采方式,介绍FastUMI改进及Pro版优势。
港中文联手美团开源“视觉推理通才”!图像视频10类任务一网打尽
香港中文大学MMLab与美团研究团队开源OneThinker模型,它可覆盖图像与视频十类核心视觉任务,在31项测试中表现出色,还展现泛化能力。研究团队搭建数据集,并引入EMA - GRPO算法提升训练稳定性。
Transformers来到了v5时代:从工具包到真理之源,AI时代的操作系统内核的极简进化论
Transformers v5发布,通过极简定义和极致互通成AI生态核心。它做减法重构代码、拓展训练流程、成推理引擎弹药库、提升量化为核心功能,连接训练、推理与部署,是AI生态通用语言。
Gemini 3 上线两周,ChatGPT 日活下降 6%,Altman 内部信拉响红色警报
2025年12月初,AI领域权力转换,Google新一代多模态模型Gemini 3挑战ChatGPT。自其发布两周,OpenAI日活降6%。Sam Altman发内部信拉响警报,要求聚焦提升ChatGPT核心体验。
把 Nano Banana/Gemini 3 Pro 榨干!这几点你必须知道
Gemini 3 放出 Pro 和 Nano Banana Pro 两条线,前者主打长上下文、多模态推理,后者专攻像素级生成。文章提炼精髓,给出“通用 + 像素”双模实战笔记,介绍两者使用要点及创意场景实测。
大模型开发者必读!拆解世界级AI模型的诞生,Hugging Face把4年模型训练经验写成了一本开源指南
Hugging Face发布《The Smol Training Playbook》,分享约4年构建SOTA模型和数据集的经验。手册涵盖是否训练、训练何种模型、如何训练等内容,强调数据质量重要性,还介绍了模型设计、训练中的实践与教训。
2025谷歌博士生奖学金揭晓,清华、科大、南大等校友入选
本周四,谷歌公布2025年度博士奖学金入围名单,获奖者来自35个国家和地区、12个研究领域,共255名博士生。文章介绍了各领域的华人研究者情况,涉及算法、架构、人机交互等多个方向。
DeepSeek重磅开源3B OCR模型,一天处理20万页文档!一天内斩获6K标星!
DeepSeek开源3B OCR模型DeepSeek - OCR,参数量仅30亿,单张A100 - 40G一天能处理20万页文档,不到24小时获6K标星。它是视觉压缩引擎,解决大模型处理长文本算力爆炸问题,有诸多技术亮点。
轻量高效,即插即用:Video-RAG为长视频理解带来新范式
现有视觉语言模型处理长视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多模态辅助文本检索增强生成,解决长视频理解问题,适用于多场景。
国产手机正从底层重构安卓!vivo版AI OS亮相了
在vivo开发者大会上,OriginOS 6正式亮相,AI功能全面更新,还首次上线Live Photo的AI消除。它用自研技术重构安卓底层核心,首发蓝河流畅引擎,从计算、显示、存储三大模块优化。