Qwen3 - VL」共找到 2175 篇相关文章

开源动态8

国产大模型持续开源的一周:DeepSeek、Qwen、字节、书生~

国产开源大模型持续发力,本周DeepSeek V3.1、字节Seed-OSS-36B等接连发布。此外,马斯克xAI正式开源Grok 2.5,英伟达也开源了Nemotron-Nano-9B-v2。PaperAgent专题进行了梳理盘点。

PaperAgent
开源动态8

单目3DGS迎来突破:影石开源UniSHARP实现全相机适配

影石研究院发布单目新视角合成模型UniSHARP,可通过单次推理秒级获场景高斯点云,支持混合相机训练与免标定推理,适配所有相机。团队还构建数据集、设benchmark,代码等均已开源。

机器之心
新闻资讯7

两个小时,10美元,Karpathy做了一个《指环王》3D游戏

Andrej Karpathy 让 Opus 5 根据《指环王》开篇文字,用 Three.js 制作三维场景,成本约 10 美元,两小时写出 5500 行代码。虽效果粗糙但有趣,他设想未来大模型能按需生成虚拟世界,不过也暴露大模型难以检查成果的问题。

机器之心
新闻资讯7

林俊旸果然创业了!一个“Qwen负责人”头衔值135亿

前阿里千问大模型负责人林俊旸离职后创业,种子轮目标估值20亿美元。他曾深度参与阿里多个大模型项目,离职首篇长文提出“Agentic Thinking”,或为创业方向。

量子位
开源动态7

LightLLM中DeepSeek V3/R1 Two MicroBatch Overlap 实现解析

文章围绕LightLLM中DeepSeek V3/R1的Two MicroBatch Overlap实现展开。介绍了该技术原理,通过拆分推理过程、精心设计执行顺序实现计算与通信重叠。还阐述了数据结构设计、预处理、核心执行流程,以及优化策略和配置启用方式。

GiantPandaLLM
算法论文8

谢赛宁团队新作:不用提示词精准实现3D画面控制

谢赛宁团队新发布的Blender Fusion框架,结合图形工具 (Blender) 与扩散模型,让视觉合成不再仅依赖文本提示,实现精准画面控制。其核心是对现有技术高效组合,还透露两项训练技巧提升泛化性。

量子位
推荐文章8

CUTE DSL学习笔记一 CUTLASS 4.3.5 CuTe DSL 文档翻译

本文是 CuTe DSL 4.3.5 文档翻译,介绍了其核心概念、使用方法、与 CUTLASS C++ 关系等。它通过 Python DSL 降低 CUDA Kernel 开发门槛,支持 JIT 编译、多种架构,还说明了当前限制与未来计划。

GiantPandaLLM
开源动态7

DeepSeek R1 迎来小更新大升级,性能直逼 OpenAI o3

昨日,DeepSeek 发布 R1 大模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。

AI科技大本营
产品应用8

1000+页PDF解析速度暴涨3倍,MinerU模式不香了

百度PaddleOCR推出HPD - Parsing小模型,文档解析速度大幅提升,是上一代最快模型的1.62倍、自身原解码方式的3.06倍。它采用层级并行解码架构,有两层并行设计,效果出色且兼容性好,还分享了优质训练方法和优化思路。

CourseAI
新闻资讯8

谷歌与OpenAI对狙,Gemini主打极速性价比,GPT优化对话温度

谷歌与OpenAI对狙,谷歌发布Gemini 3.1 Flash - Lite,主打规模化性价比,专为高频场景设计,成本低、速度快;OpenAI上线GPT - 5.3 Instant,优化对话体验,减少拒答、增强联网搜索等。

AIGC开放社区