「混元图像3.0」共找到 3112 篇相关文章
谷歌认领最强AI版Photoshop!现在人人可用,效果确实强悍
谷歌认领神秘图像编辑模型nano - banana,即Gemini 2.5 Flash Image。它可免费在Gemini和Google AI Studio使用,API收费。该模型图像编辑能力出色,能合并图片、实现2D到3D转换等,此前爆火却无官方文档。
刚刚,小红书开源了首个多模态大模型dots.vlm1,性能直追SOTA!
小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。
Switch的救世主是老黄!?
Switch2发售,其内置图形API NVN2亮相。NVN2让Switch2表现更优,应对3A大作轻松。NVN2背后是任天堂与英伟达十年合作,NVN去除通用功能减少开销,NVN2增加新特性让画面更精致。
DreamArt!只需一张图,生成可动的可交互物体
生成可动物体是具身智能等领域关键挑战,现有方法有局限。北大团队提出DreamArt框架,从单张图像生成可交互可动物体,经三阶段流程,表现优于基线方法,不过也存在生成不符物理规律等问题。
刚刚,马斯克发布Grok-4,在各大基准测试上表现太猛了。
马斯克的 xAI 发布 Grok - 4,在各大基准测试表现出色,如 AIME25 拿满分、GPQA 领先等。第三方测评显示其登顶,编码和数学指数居首。价格与 Grok 3 相同,今日上线但价格高,甚至有已售罄情况。
画质重生,第一!腾讯TEG香农实验室斩获CVPR 2025 UGC Video Enhancement 冠军
CVPR NTIRE是计算机图像恢复与增强领域有影响力的赛事。在NTIRE 2025 UGC Video Enhancement中,腾讯TEG香农实验室团队自研算法夺冠,成果落地提升视频清晰度。团队还参加实时赛道获佳绩,且做了硬件推理优化。
一文读懂:国产AI芯片与英伟达的差距有多大?
文章围绕国产AI芯片与英伟达的差距展开。从算力性能、生态壁垒、市场现状、技术瓶颈等方面分析差距,指出国产芯片虽在部分场景缩小差距,但高端训练和生态成熟度仍落后3 - 5年,突围需多领域突破。
对普通人最有用的一次!藏师傅教你用FLUX Kontext解决一切图片问题
黑森林工作室发布生成式流匹配模型 FLUX Kontext,它能编辑图片且不影响未编辑区域,支持多图参考生成新图像。可用于去水印、修复照片、修改海报、生成商品展示图等,还能美颜美体,替代 PS 等工具。
DeepSeek推理再提速80%,V4正式版定档7月中旬
DeepSeek两天前开源DSpark推理加速框架,已在V4预览版在线服务跑真实流量,使生成速度提升60% - 85%。DSpark化解推测解码问题,在多模型超Eagle3和DFlash。V4正式版7月中旬上线,将引入峰谷定价。
全球看中国,灵初智能用10万小时人类数据写下具身智能的中国答案
2026年,“世界模型”成具身智能高频词。灵初智能联合创始人陈源培认为其非核心方向,而是数据迁移工具。灵初关注人类操作数据转化,在10万小时量级上可大幅替代真机数据,还介绍了系统模块、数据集及商业化阶段等情况。