Qwen - Image - 2.0」共找到 2736 篇相关文章

开源动态8

DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini

DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。

新智元
开源动态7

The Batch: 882 | Qwen3-Next 提速

阿里巴巴对开源权重模型 Qwen3 全新升级,发布 Qwen3 - Next - 80B - A3B 的 Instruct 和 Thinking 版本权重。其融合新研究成果,推理能耗低、速度快,还优化架构和训练方法提升效率与稳定性。

DeeplearningAI
开源动态8

DeepSeek R2没来,Kimi K2来了,VLLM,SGLang首发支持

Moonshot AI发布Kimi K2大语言模型,采用混合专家架构,总参数量达1万亿。其有多项技术创新,在多个基准测试表现突出。发布两版本,用修改版MIT协议开源,vLLM、SGlang首发支持,已上线多服务。

AI工程化
开源动态8

0.07B大败QwenVL72B!百度开源OCR3.0"三件套"

OCR 历经四次范式迁移,工业落地存在精度与参数量等矛盾。百度开源 PaddleOCR 3.0“三件套”,含 PP - OCRv5、PP - StructureV3、PP - ChatOCRv4,各有创新点,解决了多语种识别、版面还原等问题。

CourseAI
开源动态7

从社区数据出发,再看大模型开源开发生态全景与趋势

蚂蚁开源先后在527蚂蚁技术日和外滩大会发布大模型开发生态开源项目全景图1.0和2.0版本。2.0版更新评估方法,呈现生态新变化,还分析技术趋势、开发者分布,提及项目进出情况及TensorFlow衰落等。

InfoQ
产品应用7

R2没来,却等来综合性能更优的DeepSeek R1T2

抱抱脸热门排行榜出现R1变体模型DeepSeek-TNG-R1T2,构建于多个父模型之上,在智能与输出token长度间达新平衡点,速度快且测试表现佳,还给出与不同模型对比的选择建议。

PaperAgent
开源动态8

工程师狂喜!Qwen3-VL 检索双雄效率翻倍

通义大模型开源Qwen3-VL-Embedding和Qwen3-VL-Reranker,解决多模态检索难题。两模型多模态全兼容,双塔+单塔协同提速,实用主义拉满,集成成本低,实战表现超预期。

CourseAI
开源动态8

谷歌开源Gemma 3 270M,性能超越Qwen 2.5同级模型

本周四,谷歌发布 Gemma 3 270M 模型,它参数小、功能强,具备指令跟踪等能力。在 IFEval 测试中表现出色,节能且适合多场景,谷歌还提供使用指南和试用途径,Gemma 系列下载量已破两亿。

机器之心
开源动态8

阿里重磅开源 0.5B TTS + 0.8B ASR,支持跨语种音色克隆、说唱识别!

2025 年 AI 圈风向变了,开始卷端侧模型。阿里 FunAudioLLM 团队发布 Fun - CosyVoice3 0.5B 和 Fun - ASR - Nano 0.8B,TTS、ASR 双线程开源,是工程级版本,目标是在本地跑顺‘听 + 说’。

开源星探
产品应用8

Sora 2瑟瑟发抖!通义万相2.5放大招:一句话出1080P电影,音画精准同步

云栖大会上通义万相2.5系列模型亮相,包含四大模型,视频生成模型实现音画同步突破,降低电影级视频创作门槛。它创作能力全方位升级,支持多种模态输入,采用原生多模态架构。

新智元