图像着色」共找到 456 篇相关文章

算法论文8

NeurIPS 2025|VFMTok: Visual Foundation Models驱动的Tokenizer时代来临

传统视觉 Tokenizer 存在缺乏高层语义信息、冗余度高、表征混乱等问题。香港大学 CVMI Lab 和阶跃星辰 AIGC 团队提出 VFMTok,用预训练视觉基础模型构造视觉 Tokenizer,实验显示其性能优异。

机器之心
产品应用8

长视频AI数字人来了!字节×浙大推出商用级音频驱动数字人模型InfinityHuman

随着内容创作智能化需求爆发,长时长、高质量数字人视频生成是痛点。字节跳动联合浙大推出商用级模型InfinityHuman,打破传统技术局限,解决身份漂移和细节失真难题,已实现多场景商用。

机器之心
新闻资讯7

The Batch: 973|Claude 的水印如何运作

Anthropic将在2026年8月2日后发布的Claude模型全球部署肉眼不可见、机器可读的水印,用于表明文本和图像由其生成。该技术基于Google的SynthID - Text,不过此公告引发广泛争议。

DeeplearningAI
新闻资讯7

聚焦物理智能最前沿,PAIR首届年度会议即将开启!

当大模型能理解语言与图像,‘物理智能’指向智能从比特到原子的跨越。2026 年 9 月 20 - 21 日,上海物理智能与机器人研究院将主办‘PAIR Conference 2026’,设主题学术和商业闭门会议。

DeepTech深科技
算法论文8

数据邪修大法好:仅用文本数据就能预训练多模态大模型

多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。

量子位
算法论文8

让扩散模型「可解释」不再降质,开启图片编辑新思路

过去三年扩散模型席卷图像生成领域,但可解释性研究是‘黑箱’,且现有尝试常致性能下降。香港中文大学与上海人工智能实验室团队提出TIDE框架,可解释且不降质,还带来新图像编辑方式。

机器之心
新闻资讯8

马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1

谷歌Gemini 3将上线消息正热时,马斯克旗下xAI的Grok 4.1凌晨上线。它有两个“形态”,免费开放且有APP版。在LMArena测试中表现优异,事实稳定性、情商、创意写作等能力提升,实测也有不错表现。

InfoQ
算法论文8

解决特斯拉「监督稀疏」难题,DriveVLA-W0用世界模型放大自动驾驶Data Scaling Law

自动驾驶领域VLA大模型面临‘监督稀疏’难题,特斯拉公布此挑战。DriveVLA - W0研究提出用世界模型解决,将‘预测未来图像’作自监督训练任务,还提出轻量级架构降低推理延迟。

机器之心
算法论文8

ACM MM 2025 Oral | 新加坡国立大学提出FractalForensics,基于分形水印的主动深度伪造检测与定位

近些年来,深度伪造主动防御受关注,但现有方法有鲁棒性不稳定等问题。新加坡国立大学等团队提出 FractalForensics 方法,基于分形水印实现主动深度伪造检测与定位,实验效果良好。

机器之心
产品应用7

承包你的品牌营销物料|谷歌再发重磅 AI 设计产品

谷歌实验室发布AI设计产品Pomelli,专注帮企业低成本生成符合品牌调性的营销物料。它能提取官网品牌元素创建DNA卡片,依此生成设计稿,还能微调细节。不过,它依赖官网信息,存在美学单调等问题。

歸藏的AI工具箱