多模态图像生成」共找到 3049 篇相关文章

算法论文8

CVPR 2026 | EmoStyle:情感也能“风格化”?深大VCC带你见证魔法!

EmoStyle由深圳大学可视计算研究中心黄惠教授课题组完成。它解决图像情感风格化两大挑战,提出有效方法、构建数据集、设计模块。实验显示其平衡情感与内容,还能扩展到文生图。

机器之心
算法论文8

谢赛宁REPA得到大幅改进,只需不到4行代码

Adobe Research等团队对REPA展开研究,发现驱动目标表征生成性能的是空间结构而非全局性能。基于此构建iREPA,代码不到4行,能提升REPA收敛速度,在多方面表现出色。

机器之心
开源动态8

告别VAE压缩损耗,南京大学用DiP让扩散模型回归像素空间,实现10倍加速与SOTA级画质

南京大学、腾讯优图实验室和新加坡国立大学发布DiP框架,即将开源。该框架不依赖VAE,仅增0.3%参数量,推理提效10倍,在ImageNet获1.79的FID分数,解决扩散模型在像素空间难兼顾质效的问题。

AIGC开放社区
算法论文8

NeurIPS 2025|VFMTok: Visual Foundation Models驱动的Tokenizer时代来临

传统视觉 Tokenizer 存在缺乏高层语义信息、冗余度高、表征混乱等问题。香港大学 CVMI Lab 和阶跃星辰 AIGC 团队提出 VFMTok,用预训练视觉基础模型构造视觉 Tokenizer,实验显示其性能优异。

机器之心
推荐文章8

一篇200+文献的视觉强化学习技术最新综述

NUS、浙江大学和香港中文大学对强化学习与视觉智能交叉领域进行系统梳理,归纳200余篇工作为四大主题支柱,剖析算法等进展,提炼关键趋势,还介绍LLM的RL方法、视觉RL阵地等。

PaperAgent
新闻资讯8

Anthropic 反杀 OpenAI,LLM 企业市场新格局

Menlo Ventures 报告显示,Anthropic 超越 OpenAI 成企业 LLM 市场新王者。代码生成成杀手级应用、强化学习成扩展路径、Agent 时代到来支撑其胜利。企业重性能,支出从训练转向推理。

AI工程化
产品应用7

AI又来带货了!字节推出DreamActor-H1自动对齐手势和商品

在电商和数字营销领域,现有框架呈现效果不佳。字节推出DreamActor - H1框架,基于扩散变换器,集成Seaweed - 7B模型,能生成高保真人机交互视频,有效果突破但也存在局限。

带你学AI
开源动态8

斩获20K星!再见PDF排版噩梦,这个开源神器让文档处理爽到飞起!

MinerU是上海人工智能实验室推出的开源数据提取工具,能将多模态文档解析为Markdown,支持精准提取图片、表格、公式,具有多语言支持、高性能等特点,应用场景广泛,还开源免费。

小华同学ai
新闻资讯8

Scaling没有墙!Anthropic CEO:AI实验室真相远超公众想象

Anthropic CEO Dario Amodei在摩根士丹利会议称Scaling Law未撞墙,2026年将激进加速。他用棋盘稻米寓言比喻,称当前处第40格,前39格增长只是前奏。还透露代码生成是AI能力爆发指标,Anthropic或在RSI取得进展,且重视人才文化。

新智元
开源动态8

清华开源一批「学习虾」,免费的「AI 私教团」来了

清华大学开源全球首个多智能体生成式学习AI技术框架OpenMAIC。它能将技术文档转化为学习课堂,还能解锁多种学习解法。其前身MAIC是重要学习平台,应用不断迭代,OpenMAIC功能强大,边界不止于课堂。

AI科技评论