视觉生成调优」共找到 2722 篇相关文章

产品应用8

V0做不到、Bolt搞不定,Youware用MCP一键解决网页生成最大难题

Youware可快速将AI生成网页部署到线上。其更新后支持调用MCP生成网页,深度适配主流MCP服务,使用门槛低且免费。还上线积分系统,首页分类筛选更详细,作品页增随机按钮。用案例展示了其强大的网页生成能力。

歸藏的AI工具箱
开源动态8

社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型

Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。

Hugging Face
算法论文8

AI打通第一/第三人称视觉,跨视角视觉理解新SOTA|ICCV 2025 Highlight

INSAIT、复旦大学等联合提出ObjectRelator框架,让AI精准匹配不同视角下同一物体,实现跨视角统一表征与理解。它在Ego转Exo和Exo转Ego任务上超基线模型,已被ICCV 2025接收,代码开源。

量子位
算法论文8

让AI像人类画家一样边画边想,港中文&美团让模型「走一步看一步」

在文生图和视频生成领域,现有模型处理复杂任务常出错。港中文和美团团队提出TwiG范式,将视觉生成拆解为“生成-思考-再生成”循环,经实验验证有效,有望拓展到更多领域。

量子位
开源动态7

从科学论文自动生成视频

该项目解决学术演示两核心问题,用智能体PaperTalker生成视频,还设Paper2Video基准评估。介绍了PaperTalker使用步骤,含环境、配置、推理,也说明了Paper2Video评估指标及运行方法。

GitHubStore
新闻资讯7

The Batch: 937 |OpenAI 退出视频生成领域

OpenAI计划关闭视频生成器Sora,将资源重新分配到更有盈利性的投资中。Sora虽能生成高质量视频,但生成耗时久、计算成本高,日亏损约100万美元,其与迪士尼的合作也将结束。

DeeplearningAI
算法论文8

AdaGen: 让图像生成模型学会自适应策略

当前主流图像生成模型多步策略依赖手工静态调度规则,存在需大量调参、无法适配样本特性的问题。本文提出AdaGen框架,通过强化学习训练策略网络,在四大生成范式上实现性能提升与效率优化。

机器之心
推荐文章7

根据 YouTube 视频生成 Blog 文章的提示词

文章给出根据YouTube视频生成Blog文章的提示词,涵盖核心创作原则、文章生成流程与要求、全局风格与限制等,指导创作者将视频内容转化为优质博客文章。

宝玉AI
算法论文7

The Batch: 931 | 统一视觉媒体的单一分词器

Apple团队开发多维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经多阶段训练,在多任务上达或接近先进水平,为视觉模型带来通用性。

DeeplearningAI
新闻资讯7

Gartner发布生成式AI模型提供商魔力象限

Gartner发布《生成式AI模型提供商创新指南》,首次对生成式AI市场进行象限划分,按功能完整性和未来潜力将厂商分为新兴领导者、新兴挑战者、新兴远见者和新兴专家四个区域,还指出AI正从实验转向企业核心层。

AI工程化