图像驱动」共找到 1037 篇相关文章

开源动态8

不堆参数堆架构,这个8B开源模型把图像理解和生成统一了

商汤开源全新架构的理解生成统一模型SenseNova-U1,虽小尺寸版仅8B参数,却能复刻GPT - Image - 2的不少绝活,在多项指标上登顶开源模型榜首,推理速度逼近主流商用闭源模型。它具备连续性图文创作等能力,底层是NEO - unify架构。

量子位
新闻资讯8

谷歌「最强图像模型」横扫一切!3毛钱P图打懵OpenAI,PS要不存在了

谷歌发布顶级图像模型Gemini 2.5 Flash Image,化身nano - banana在LMArena盲测夺冠。它有四大能力,价格低至每张图不到3毛钱,冲击传统P图工具,虽有小瑕疵但应用前景广。

新智元
新闻资讯7

讲座分享 | 密歇根大学Karthik Duraisamy教授

密歇根大学Karthik Duraisamy教授将开展讲座,主题为数据驱动的湍流建模。会介绍过去十年嵌入学习模型增强的进展,强调简约与约束平衡,指出存在的陷阱及挑战,还提及让数据驱动封闭成为可靠组件的要点。

力学与人工智能
新闻资讯8

AI生图大洗牌!流匹配架构颠覆传统,一个模型同时接受文本和图像输入

AI生图有新突破,新模型FLUX.1 Kontext用流匹配架构,与此前技术不同,能接受文本和图像输入。其来自Black Forest Labs,有编辑和生成能力,还具备4个特性,第三方测试也给出提示词使用技巧。

量子位
算法论文8

UofT、UBC、MIT和复旦等联合发布:扩散模型驱动的异常检测与生成全面综述

多伦多大学、麻省理工学院等高校研究者合作完成长文综述,聚焦扩散模型在异常检测与生成领域的应用,梳理图像、视频等异常检测任务进展,提供分类体系,展望未来趋势。

机器之心
产品应用8

AI生图迎来大升级:图像编辑达到像素级!背后团队大多来自Stable Diffusion模型基础技术发明团队

Stable Diffusion缔造者团队创立的 BFL 发布全新图像生成模型 FLUX.1 Kontext,可实现像素级图像编辑。它能以文本和图像为输入,有 Pro、Max、Dev 三版本,已在多平台上线,获用户好评,但也面临竞争。

AI前线
产品应用8

长视频AI数字人来了!字节×浙大推出商用级音频驱动数字人模型InfinityHuman

随着内容创作智能化需求爆发,长时长、高质量数字人视频生成是痛点。字节跳动联合浙大推出商用级模型InfinityHuman,打破传统技术局限,解决身份漂移和细节失真难题,已实现多场景商用。

机器之心
算法论文8

ICCV 2025|UV-CoT:无监督视觉推理新突破,偏好优化重塑图像级思维链

随着文本领域思维链推理机制成功应用,研究者将其引入视觉理解任务。现有模型有局限,本文提出UV - CoT新框架,设计无监督数据生成与偏好优化机制,提升模型能力,摆脱对人工标注依赖。

机器之心
开源动态8

GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”

智源研究院发布国产开源统一图像生成模型OmniGen 2.0版本。它增强理解与生成能力,打通多模态生态。玩法简单,技术有创新,还引入反思机制和新基准,推理效率提升,且将全面开源。

量子位
推荐文章7

RAG系统设计:揭秘语义搜索被低估的核心价值与KG驱动的架构选型策略

在AICon大会上,Hugging Face的尹一峰探讨基于语义搜索的RAG系统重要性,揭示其被低估原因,分析本质与作用,分享设计高效架构方法,还讨论KG驱动的RAG系统及范式选择。

AI前线