文本到图像生成」共找到 2675 篇相关文章

产品应用8

拯救P图废柴,阿里上新多模态模型Qwen-VLo!人人免费可玩

昨夜阿里推出全新多模态模型Qwen-VLo,在原有能力上全面升级,有细节捕捉、图像编辑、多语言支持等亮点,不受固定格式限制。官方demo展示多种玩法,目前免费可玩,实测其编辑能力不错。

量子位
算法论文8

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。

机器之心
推荐文章8

AI科研全周期拆解:从选题到宣发,哪里能放手,哪里得盯着

Awesome AI Auto-Research Team 综述梳理 AI 科研全周期能力与局限,按四阶段八环节拆解,介绍五种方法范式,指出各阶段应用情况、瓶颈及规律,强调人本治理的 AI 辅助科研才是可信路径。

AIGC开放社区
推荐文章7

数据合成有没有未来?事实结论来了

有人认为用大模型合成数据可快速生产,无需人工标注。但作者观察发现人工标注不仅必要且要求更高。以Scale AI、Surge AI为例说明标注价值,还展示‘智能知识’团队对两数据集审查结果,证明高质量数据需专家和管理流程。

AI工程化
算法论文8

显存暴降92%!哈工大为线性注意力开辟了新道路

哈尔滨工业大学等团队发现线性注意力性能不足根源是查询范数丢失等。基于此提出NaLaFormer,在ImageNet - 1K准确率最高提7.5%,超分任务峰值内存降92.3%,为线性注意力发展开辟新道路。

AIGC开放社区
开源动态8

字节开源版Seedance发布,超越Sora 2!

字节Alive团队发布开源版Seedance 2.0,在人类评估中超越Sora 2等。它通过统一架构、时空对齐技术和非对称训练策略,解决声画不同步和画质音质难两全问题,还建立数据流水线和测试基准。

AIGC开放社区
产品应用7

AI生的图能分图层,Agent控制能力进入下半场

Lovart上线Layered Image Editing功能,可自动识别图片里的文字、主体、背景并拆成独立图层,每个图层能单独编辑。其还有快速模式,模型库更新快,能降低AI生图门槛。

探索AGI
新闻资讯7

Oracle 推出 MySQL AI

Oracle 推出仅在 MySQL 企业版提供的 MySQL AI,用于处理分析和 AI 工作负载。它有向量存储等功能,新 AI 引擎含四大核心组件。但 MySQL 社区担忧社区版未来及供应商锁定问题。

InfoQ
7

ChatGPT新功能,抢占你早上第一个打开的App

ChatGPT推出新功能Pulse,无需提问就可自动推送个性化更新。OpenAI应用程序首席执行官认为过去ChatGPT很被动,现在Pulse主动出击。不过网友质疑是广告推荐。目前该功能仅Pro用户可用。

量子位
开源动态8

Jina Code Embeddings: 为高质量代码搜索而生的0.5B/1.5B向量模型

本文介绍了 Jina AI 开源的代码向量模型 `jina-code-embeddings`,含 0.5B 和 1.5B 规模,有 GGUF 量化版本。它性能顶尖,支持多任务与 15 种语言,还介绍了训练方案、使用方法等。

Jina AI