组合式图像创作」共找到 769 篇相关文章

新闻资讯7

CVPR 2025 Tutorial:从视频生成到世界模型 | MMLab@NTU团队&快手可灵等联合呈现

图像生成普及,视频生成也有高质量发展,可灵、Sora等模型不断拓宽边界。CVPR 2025 Tutorial将探讨视频生成能否成世界模型桥梁、具身智能核心能力等问题,汇聚一线研究者分享。

量子位
算法论文8

中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考

上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。

机器之心
算法论文8

只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026

多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。

量子位
算法论文8

港大赵恒爽团队论文:让扩散模型既拿高分又不「作弊」丨CVPR 2026

扩散模型虽能生成逼真图像,但存在“奖励作弊”问题。港大赵恒爽团队提出 GDRO 后训练方法,引入组级奖励优化机制,提升模型表现、缓解作弊,还提高训练效率,有明显工程价值。

AI科技评论
算法论文8

治好多模态近视和走神!上海大学去偏干预显著提升模型性能

多模态大模型存在“近视”和“走神”问题,总是过度关注图像底部而忽略核心内容。上海大学与南开大学研究团队用两条数学公式去偏干预,无需增加计算成本,却能显著提升主流模型视觉理解能力。

AIGC开放社区
产品应用8

老黄挤爆牙膏!DLSS 4.5狂飙6倍,RTX 50系直接封神

2026年CES大会上,英伟达发布DLSS 4.5提升画质与帧生成,RTX Remix助力经典游戏重生,还将NPC变智能伙伴。同时,其软件升级利好AI PC,提升性能、减少显存消耗,让它更接近日常使用。

新智元
新闻资讯7

千问:阿里第二次“无线战争”

本文以乔布斯用 iPhone 点咖啡引出当下科技圈流行发布会点咖啡展示 AI 能力,对比过去与现在,指出数字世界核心范式从移动转向 AI。介绍阿里千问饱和式投入情况,还分析其可能借鉴拼多多、抖音策略,站在长尾对立面。

乱翻书
新闻资讯7

OiiOii意外走红背后:为何10万人排队等一个不完美的AI Agent?|甲子光年

OiiOii是成立不到半年、团队仅十余人的初创公司,产品尚处内测,却引来近10万人排队申请。创始人闹闹有丰富履历,不回避产品缺陷,公司已获天使轮融资,将全力投入迭代。

甲子光年
产品应用7

Nano Banana Pro或将引爆新安全危机

基于Gemini 3的图像生成模型Nano Banana Pro昨日上线,支持2K/4K分辨率生成,排版和文字控制能力提升。它展现出复杂推理能力,能理解反光、推理指纹,但这或带来隐私危机。

AI工程化
开源动态8

小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索多模态智能新维度

小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型。

量子位