「Ovis-Image」共找到 111 篇相关文章
中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考
上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。
火速吃瓜,OpenAI模型还没发又惹出争议了??
GPT - 6发布前夕消息不断,OpenAI新模型引入的“循环深度”技术因可能让模型思考难监控引争议,同时模型名或被API剧透,图像模型GPT Images 2.1也将更新。
谷歌「最强图像模型」横扫一切!3毛钱P图打懵OpenAI,PS要不存在了
谷歌发布顶级图像模型Gemini 2.5 Flash Image,化身nano - banana在LMArena盲测夺冠。它有四大能力,价格低至每张图不到3毛钱,冲击传统P图工具,虽有小瑕疵但应用前景广。
刚刚,智谱和华为搞波大的:中国首个国产芯片训练出的SOTA多模态模型!
智谱与华为合作开源新一代图像生成模型GLM-Image,是中国首个全程用国产芯片训练的SOTA多模态模型,擅长文字渲染,拿下多项榜单第一,API调用一张图只要0.1元,还解析了其技术架构。
这个春节P图不求人!小红书开源图像编辑新SOTA
今日小红书基础模型FireRed - Image - Edit亮相,在复杂编辑指令、风格化转换等核心指标表现强,在多项权威测试达SOTA。该项目代码等已开源,模型权重将开源。团队还推出RedEdit Bench评测方案。
谷歌Nano Banana全网刷屏,起底背后团队
谷歌开发者节目展示了Gemini 2.5 Flash Image模型,它能快速生成高质量图像、保持场景一致。文中起底背后团队成员,还介绍模型技术亮点、与Imagen对比及未来能力展望。
这事你还没注意呢,巨无霸已经完成“反超时刻”
过去 GPT 在 AI 领域一枝独秀,大家认为二三名与它有代际差距。但 Google 的 Gemini 2.5 Flash Image 发布后,其生图速度和质量提升,解决“连续性”问题,带来自然交互体验,标志 AI 进入新阶段。
Meta首个Agent生图模型登场,空降竞技场第二
Meta超智能实验室推出图像生成模型Muse Image,引入智能体机制,能编写代码、网络搜索,有自主修正能力,支持算力扩展、多轮编辑与画面合成。还预览了Muse Video,两模型均与Meta产品深度整合。
生图效果媲美GPT-4o,一键搞定各类视觉生成任务丨港科广&字节全新框架
港科大(广州)和字节联合推出开源框架ComfyMind,它是通用视觉生成框架,能统一处理主流视觉生成任务。其性能超现有开源方法,媲美GPT - 4o - Image,还介绍了架构、接口等及性能评估情况。
统一架构新思考,北大团队UniWorld-V1统一大模型
北大袁粒课题组提出统一大模型架构UniWorld-V1。通过对GPT - 4o - Image实验,发现其依赖语义编码器提取视觉特征,据此设计架构,在多基准测试表现优异,开源代码等促进研究。