「图像图形技术」共找到 3231 篇相关文章
告别VAE压缩损耗,南京大学用DiP让扩散模型回归像素空间,实现10倍加速与SOTA级画质
南京大学、腾讯优图实验室和新加坡国立大学发布DiP框架,即将开源。该框架不依赖VAE,仅增0.3%参数量,推理提效10倍,在ImageNet获1.79的FID分数,解决扩散模型在像素空间难兼顾质效的问题。
Mistral 3发布,14B多模态小模型表现优异
Mistral AI第三代模型发布,含三个小型密集模型和稀疏混合专家模型Mistral Large 3,全用Apache 2.0许可。有多项技术亮点,Ollama等支持部署微调,还给出实用配置建议。
金山与华科发布多模态模型MonkeyOCR v1.5:文档解析能力超越PaddleOCR-VL,复杂表格解析首次突破90%
2025年6月以来多模态文档解析成前沿课题。MonkeyOCR v1.5是全新框架,在OmniDocBench v1.5等基准上全面突破,复杂表格等场景提升9.7%,采用两阶段解析管道和复杂表格处理方案。
李飞飞最新思考:语言模型救不了机器人
本文是对李飞飞的访谈编译。她指出语言模型在世界理解上有短板,空间智能是关键,还探讨了AI发展历程、世界模型重要性等,介绍其公司产品Marble,强调人人在AI时代都有位置。
AI+直播的新玩法! StreamDiffusionV2让创意零延迟
生成模型改变直播行业,但此前模型难保证时间一致性、有延迟等问题。加利福尼亚大学推出StreamDiffusionV2,通过智能调度和缓存机制优化,支持多GPU并行,可灵活调画质和延迟,实现实时直播。
Nature子刊:太空中建数据中心,无限能源,浙大首次证实可行!
浙江大学和新加坡南洋理工大学新研究探索太空碳中和数据中心可行性。太空有太阳能与散热优势,提出轨道边缘和轨道云数据中心方案,还建立全生命周期碳效率评估体系,虽有挑战但前景好。
刚刚,AI大牛刘威视频创业公司Video Rebirth,完成5000万美元融资
AI视频初创公司Video Rebirth完成5000万美元融资,由刘威博士创立,致力于打造“视频原生的世界模型”。融资用于视频模型迭代等,解决行业痛点,其核心创新机制让模型表现突出。
NVIDIA重磅开源!OmniVinci 仅 9B 模型就拿下多模态冠军!
英伟达推出全模态大语言模型 OmniVinci,架构有三大创新。OmniVinci - 9B 模型表现亮眼,多测试中大幅超 Qwen2.5 - Omni,且训练量仅为其六分之一。其架构经多阶段流程实现全模态理解,还支持多种功能。
世界模型有了开源基座Emu3.5!拿下多模态SOTA,性能超越Nano Banana
北京智源人工智能研究院的悟界·Emu3.5是最新最强的开源原生多模态世界模型,能处理图、文、视频任务,在多项权威基准上性能亮眼,还具备理解长时序等能力,背后有技术创新,且选择开源。
ICCV 2025 | 港科、牛津大学发布AlignGuard,文图生成模型可规模化安全对齐框架
随着文图生成模型广泛应用,其安全防护机制有限。ICCV 2025上,港科、牛津大学推出AlignGuard,是文图生成模型可规模化安全对齐框架,通过生成CoProV2数据集等实现安全对齐,实验效果佳。