多模态图像生成」共找到 3041 篇相关文章

开源动态8

社区供稿 | Jina Embeddings V4: 为搜索而生,多模态多语言向量模型

Jina AI发布多模态向量模型jina-embeddings-v4,参数38亿,能同步处理文本与图像。内置LoRA适配器强化检索等任务表现,在多基准测试中展现顶尖性能,支持单/多向量表示。介绍了架构、上手指南等。

Hugging Face
开源动态7

MIDAS:快手可灵发布实时交互式数字人生成框架

近年来交互式数字人视频生成受关注,但实时处理多模态输入有挑战。快手可灵团队提出MIDAS框架,基于LLM驱动的自回归模型,结合轻量级扩散头,实现低延迟、交互式多模态控制,还构建大规模数据集等。

带你学AI
产品应用8

Qwen-Image-2.0: 字字清晰,张张细腻

阿里云推出Qwen-Image-2.0图像生成基础模型,具专业文字渲染、细腻真实质感等特色。在AI Arena盲测中表现优越,能精准生成复杂内容,文字渲染有准、多、美、真、齐特点,图像编辑能力也得到增强。

千问Qwen
产品应用8

谷歌Nano Banana Pro炸了!硅谷AI半壁江山同框,网友:PS已死

谷歌推出基于Gemini 3 Pro的图像生成模型Nano Banana Pro,在图像编辑和生成上实现史诗级进化,有更广知识储备、超强文字渲染和精准细节把控。它支持4K原生,知识推理强还能直连搜索,玩法多样但也有改进空间。

新智元
开源动态7

一个强大的知识图谱生成工具

这是基于Streamlit的应用程序,用LangChain和OpenAI的GPT模型从文本提取图谱数据并生成交互式图谱。有两种输入方式,具备可视化等特性,还给出安装、运行等指南。

GitHubStore
算法论文8

工具增强的多模态LLM综述

多模态大语言模型(如GPT - 4V)虽有强大图文理解能力,但受数据稀缺、复杂任务表现不佳和评估标准不统一限制。论文提出为MLLM集成外部工具,构建全景图,覆盖多维度,还指出挑战与对策。

深度学习自然语言处理
开源动态7

自动生成 AI 领域 Reddit 趋势报告

该项目可自动从Reddit AI相关社区生成双语趋势报告。具备实时监控、多社区分析等功能,有详细趋势分析。介绍了安装设置、使用方法、创建仓库、自定义配置等内容,助用户掌握AI领域发展。

GitHubStore
产品应用7

美国州政府生成式AI应用报告

今年2月,美国阿拉巴马州州长签署行政命令推动生成式AI在州政府大面积应用,并发布深度应用报告。报告涵盖应用现状、伦理风险与策略、数据管理、政策治理等方面,为生成式AI在政府应用提供指引。

AIGC开放社区
产品应用8

50万个AI生成的应用,正在赚钱

在2025秒哒创造者大会上可知,“三无”AI生成应用已诞生50万个商业应用,覆盖200多个细分领域。如“荣堂古村数字博物馆”等,它们变现能力强。秒哒是相关工具,操作简单,技术体系完整。

量子位
开源动态8

大模型能否为不同硬件平台生成高性能内核?南大、浙大提出跨平台内核生成评测框架MultiKernelBench

深度学习计算依赖底层内核,当前多由开发者手工编写。南大、浙大推出开源评测框架MultiKernelBench,打破现有评测基准局限,构建模块化评测体系,多模型实测,还指出LLM短板并明确未来方向。

机器之心