「开源视觉模型」共找到 8949 篇相关文章
QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5
通义文档智能团队推出QwenLong - L1.5长文本推理专家,提供端到端长文本推理后训练“配方”,含数据合成管线、强化学习方法、智能体架构,在多基准测试成绩佳,代码已开源。
拒绝Reward Hacking!港科联合快手可灵提出高效强化学习后训练扩散模型新范式
使用强化学习微调扩散模型时,常面临Reward Hacking和KL正则化阻碍探索收敛的问题。港科等团队提出GARDO框架,通过门控自适应正则化和多样性感知优化,解决痛点且全面开源。
社区供稿丨Ring-2.5-1T,思更深,行更远
今天发布并开源万亿参数思考模型 Ring-2.5-1T,在生成效率、思考深度、长程执行上大幅提升。与其他模型对比,在高难推理和长程任务执行达开源领先。介绍架构优势、手搓案例,也提及不足与未来计划。
刚刚,新版DeepSeek-R1正式开源!直逼o3编程强到离谱,一手实测来了
临近端午假期,新版DeepSeek - R1凌晨正式开源,模型权重已上传到HuggingFace。其性能几乎与o4 - mini(Medium)相当,编程实测超越Claude 4 Sonnet。有多项更新亮点,经实测性能获“史诗级”加强。
图像界的DeepSeek!12B参数对标GPT-4o,5秒出图,消费级硬件就能玩转编辑生成
Black Forest Labs开源旗舰图像模型FLUX.1 Kontext[dev],专为图像编辑打造,能在消费级芯片运行。12B参数少、推理快,性能媲美闭源模型。有诸多特点,经优化训练,在KontextBench基准表现优。
上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”
上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。
7×24h「全职AI员工」爆火硅谷!退休码农让Mac mini一夜卖爆
由Peter Steinberger开发的开源项目Clawdbot爆火硅谷,它可在Mac mini上运行,能调用多种模型,还能通过聊天APP对话。它解决了主流大模型记忆力痛点,重塑了个人AI超级助手定义,还带火了Mac mini。
录屏扒代码、截图改网页!Kimi K2.5把「视觉x代码」玩明白了
Moonshot AI推出最强Agentic模型Kimi K2.5,发布后热度起飞。它实现多功能一体化整合,具备设计审美,支持可视化编辑,推出编程工具Kimi Code。在多项测试中表现优异,还能在办公领域发挥作用,其智能体集群提升了效率。
阿里通义新年礼物:开源最强Qwen-Image-2512版本告别AI塑料感与文字乱码
通义万相新年前发布Qwen - Image - 2512版本。它是开源界最强文生图模型,在AI Arena盲测中表现出色。能消除AI塑料感,攻克文字渲染难题,在还原真实世界和重构视觉元素逻辑排版上有显著提升。
一场文心大模型的「AI马拉松」
2025 年模型能力至关重要,百度在基础模型研发持续投入。百度 AI Day 上,吴甜解读文心新模型技术,文心 X1 Turbo 推理强、成本低。百度技术体系完备,未来看好多模态与智能体,降成本促应用生态发展。