多模态图像生成」共找到 3041 篇相关文章

算法论文8

打破确定性魔咒!北航团队提出VBF++:用“不确定性建模”刷新多模态视频推荐 SOTA

北京航空航天大学和北京邮电大学联合提出VBF++框架,将多模态融合从“点估计”升级为“分布建模”。它由上下文感知先验、推荐引导的对抗优化和元学习三大组件构成,在多个数据集上刷新SOTA。

AI前线
新闻资讯7

Midjourney新副业曝光:50万个传感器藏进浴池,60秒生成你的3D身体地图

搞AI绘画的Midjourney官宣将在旧金山开Spa馆,背后是进军医疗硬件的新项目Midjourney Medical。其用Midjourney Scanner做全身超声波扫描,能快速生成高精度3D身体地图,还规划了落地路径和长期扩张目标。

量子位
产品应用7

别让Nano Banana骗了!混合方案让头像生成成功率从0到100%

作者用Nano banana更新头像时发现其生成中文能力差,提出将AI画图与HTML编程结合的方案。HTML搞定确定性、成本低部分,AI画图负责复杂、创意性高部分,还给出使用方法及多种头像加字设计方案。

AI 产品自由
新闻资讯8

拥有Github 的微软终于出手,发布一键生成全栈应用的GitHub Spark!

微软发布GitHub Spark,能以自然语言生成全栈应用并一键部署,默认用Claude Sonnet 4。它遵循微应用理念,有强大功能体系,深度集成GitHub。开发者看法不一,目前向Copilot Pro+用户开放,或改变市场格局。

AGI Hunt
算法论文8

NeurIPS 2025 | 告别全量扫描!浙大提出COIDO:破解多模态数据选择「高耗」难题

浙大提出 COIDO 框架解决多模态数据选择「高耗」难题。它摒弃全量扫描,用轻量级评分器和小样本采样,将重要性和多样性的优化统一。实验显示,它性能与效率双优且有强泛化性。

机器之心
新闻资讯7

Meta扩张继续!挖走OpenAI 2名多模态AI研发人员,收购语音初创公司PlayAI

据报道,Meta 首席执行官扎克伯格从 OpenAI 挖走 2 名多模态 AI 研发人员,还完成对语音初创公司 PlayAI 的收购。Meta 近期在 AI 人才争夺上攻势猛,想补足短板,其超级智能团队未来表现值得关注。

机器之心
新闻资讯8

谷歌“世界模拟器”深夜上线!一句话生成3D世界,支持分钟级超长记忆

谷歌DeepMind发布新一代通用世界模型Genie 3,只需一句话就能生成可实时交互的3D世界。性能大幅升级,支持720P画质等,还能推动具身智能体研究,谷歌期待其助力迈向AGI。

量子位
产品应用7

Medeo 教程:一次生成无脑抽卡不可取,真正的视频 Agent 应该啥样

本文介绍AI视频生成Agent Medeo 1.0版本,它支持短或超长提示词,泛化性好,多种垂类视频都能做。文中介绍其基础操作、展示案例和提示词,还剖析了能兼顾质量与灵活度的原因,目前产品在内测将全量上线。

歸藏的AI工具箱
算法论文7

“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%

多模态长文档视觉问答常见于科研论文等场景,现有技术路线有大视觉 - 语言模型直接端到端和检索增强生成,但各有缺点。MMRAG - DocQA引入新方案,解决多模态连接和跨页证据链接问题。

PaperAgent
产品应用7

实测惊艳全球的Veo3!音画同步无敌,贵是有原因的

谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。

机器之心