「视觉特征编码器」共找到 792 篇相关文章
黑森林FLUX.2 Klein开源,亚秒级高质量图像生成和编辑,普通电脑就能跑
黑森林实验室发布开源的FLUX.2 Klein模型家族,是紧凑架构,将高质量图像生成与编辑速度压缩至亚秒级,在消费级显卡实现旗舰性能。其统一架构打破生成与编辑壁垒,还与NVIDIA合作优化。
今天的AI基建狂潮,恰如150年前铁路狂潮的历史轮回
文章指出铁路与AI这两场相隔150年的基建狂潮,上演着相同剧本:技术突破引发资本涌入,过度建设致过剩,泡沫破灭后洗牌。回顾美国铁路建设兴衰,类比当下AI投资,给出周期阶段信号及价值转移路径。
首个地球科学智能体Earth-Agent来了,解锁地球观测数据分析新范式
上海人工智能实验室与中山大学联合研发的 Earth - Agent 解决了多模态大语言模型用于地球科学研究的痛点。它将领域知识工具封装化,利用 LLM 智能规划调度。经 Earth - Bench 评估,其在多方面表现出色,未来发展前景广阔。
ICCV 2025 | ECD:高质量合成图表数据集,提升开源MLLM图表理解能力
科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据集,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。
X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据集上均达SoTA
中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。
Omni-Effects:首个统一多特效生成框架
Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。
Nature:锂可逆转老年痴呆
Nature报道,补充大脑锂储备可预防甚至逆转阿尔茨海默病。研究通过小鼠实验发现,乳清酸锂能逆转神经病变、消除记忆障碍。此前锂多用于精神药物,此次发现或为老年痴呆治疗带来新方向。
ICLR 2025新成果:文档检索“降本增效”,从此“开挂”
传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展到图文+音频多模态匹配。
ACL 2025 Oral | 你的模型评测搭子上线:Evaluation Agent懂你更懂AI
上海人工智能实验室与新加坡南洋理工大学合作研发 Evaluation Agent,它能按需评估视觉生成模型,有可定制、高效率等优势。框架分提案和执行两阶段,评估结果佳,未来将拓展功能。
长篇动画上色稳如老狗!全新开源LongAnimation
动画上色是制作长篇动画时“烧脑”又“烧钱”的环节,现有AI主流方法多为局部处理,易导致色彩漂移、风格不统一。中国科学技术大学团队提出动态全局 - 局部范式,构建LongAnimation框架,可确保长动画色彩一致。