组合式图像创作」共找到 769 篇相关文章

算法论文8

图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理

华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。

机器之心
算法论文8

IEEE TVCG | 告别写代码!MoGraphGPT:基于模块化大模型与图形控制的2D交互场景创作

香港多所高校研究团队提出 MoGraphGPT 系统,结合上下文感知模块化大模型与图形化控制,能让用户零代码搭建 2D 交互场景。该成果被 IEEE TVCG 录用,还对比实验验证其优势。

机器之心
算法论文8

让大模型基于「图像事实」说话:用事实文本+自适应编辑,让语言偏见无处遁形丨ICLR'26

多模态大模型看图常“脑补”,存在对象幻觉问题。北航团队提出AFTER框架,含FAS和QAO模块,能在主流LVLM和基准上显著降低幻觉,且推理开销低,为多模态助手落地提供实用路径。

量子位
算法论文8

从视觉出发统一多模态!颜水成团队最新研究:不再把图像编解码器塞进LLM|ICLR'2026

NVIDIA研究员Jim Fan称AI正经历第二次预训练范式转移。颜水成团队Muddit模型从视觉先验出发,用离散扩散框架统一文生图、图生文和VQA,挑战多模态“语言中心论”,在多任务表现出色。

量子位
开源动态8

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26

当前图像编辑模型处理三维状态常出错。浙江大学ReLER团队提出并开源PhyEdit,用显式3D几何preview指导图像编辑,还加入深度监督,构建数据集和评测基准,成绩超Nano Banana Pro,且GUI也开源。

量子位
新闻资讯8

谷歌年度大招:所有AI模型全升级一遍!Gemini2.5大杯中杯霸榜前二,新版视频/图像模型亮相

谷歌在I/O大会放大招,升级所有AI模型,重做原有产品,推出诸多实验性新产品。如Gemini 2.5系列升级,具备新功能;还有异步代码助手Jules、新搜索模式等,多模态模型也全线升级。

量子位
产品应用7

微信可以用“龙虾”了!(附教程)

腾讯22日发布消息,微信正式推出“ClawBot”插件,支持接入OpenClaw。用户扫码或复制命令接入后,能在微信聊天中快速调用“龙虾”,用于学习、工作、创作等场景。

昆明走进自然户外
开源动态7

无需 OCR 就能从各类文档中提取结构化信息的本地化开源工具docext

docext是无需OCR的本地化开源工具,能从发票、护照等文档图像提取结构化信息。智能文档处理排行榜评估VLMs在多任务表现,docext有灵活提取、表格提取等功能。

GitHubStore
新闻资讯8

奥特曼「红色警戒」5个月后,GPT Image 2屠榜,断层领先反杀谷歌

被Google按了半年头,OpenAI祭出反杀。GPT Image 2上线12小时登顶Arena文生图榜,领先Nano Banana 2达241分。它是从零重构的通用模型,具备原生思考能力,或改写图像生成赛道规则。

新智元
产品应用7

Anthropic重磅更新skill-creator:创建skill全面告别“草台班子”时代

Anthropic升级skill - creator,让普通人创建skill更友好且有效。将测试等机制引入创作,能验证skill有效性。还支持多智能体并行测试、A/B测试,优化触发描述,为未来自然语言定义skill过渡。

AI寒武纪