「视觉-文本激活编辑」共找到 1120 篇相关文章
ICLR 2026 | 当视频难以被表征:UCSD、HKUST等机构联合提出FlowRVS,用生成式流匹配重构视觉感知范式
计算机视觉领域传统表征方法在视频处理上力不从心,SGIT AI Lab等机构团队提出FlowRVS,跳出传统桎梏,用生成式流匹配重构视觉感知范式,实现SOTA提升,还展现诸多优势,证明Flow Matching理论普适性。
文生图Scaling新变量,被字节Seed团队发现了
ByteDance Seed团队研究发现,文生图模型中自然语言Caption变长,不意味着模型获更多视觉监督,其信息量更能预测训练损失。团队提出Structured Prompt,从两侧提升文本条件,在多任务上取得显著提升。
终结多智能体视觉幻觉“滚雪球”!新国立等提出ViF:无需改造模型,即插即用
多智能体协同做视觉任务常轮次越多错得越离谱,根源是信息传递方式有缺陷。新国立等研究人员提出轻量通用的ViF范式,无需改造基座模型,可大幅压制幻觉滚雪球,已入选ICLR 2026。
JinaVDR: 一个图文混排文档搜索任务的基准集
现有文档检索基准大多只考虑纯文本,难以处理含图表等视觉信息的文档。JinaVDR 应运而生,它是图文混排文档搜索基准集,含多语言、多领域数据,可评估模型在复杂视觉文档的检索性能。
杨植麟亲自发布,月之暗面最强模型Kimi K2.5开源
杨植麟发布月之暗面最强模型Kimi K2.5,经约15万亿视觉与文本混合数据预训练,有顶尖编程与视觉能力及智能体蜂群范式。在多基准测试表现优,成本低于对手,还能提升办公生产力。
ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力
最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。
NeurIPS 2025|VFMTok: Visual Foundation Models驱动的Tokenizer时代来临
传统视觉 Tokenizer 存在缺乏高层语义信息、冗余度高、表征混乱等问题。香港大学 CVMI Lab 和阶跃星辰 AIGC 团队提出 VFMTok,用预训练视觉基础模型构造视觉 Tokenizer,实验显示其性能优异。
真正能用好AI的企业是怎么做的?(附企业级AI落地实战手册)
数字化深入,非结构化文档成企业难题。合合信息发布白皮书,提出复杂文本智能五大核心能力标准,用11个行业标杆案例展示多模态文本智能技术应用,提供可复制落地范本。
ICCV25 Highlight|格灵深瞳RICE模型狂刷榜单,让AI「看懂」图片的每个细节
格灵深瞳公司灵感团队自研的视觉模型基座RICE(MVT v1.5)刷榜多项视觉任务,在ICCV25获Highlight荣誉。它延续MVT系列理念,提升图片内部视觉特征差异性,在多任务验证中表现优异。
腾讯提出Vision-SR1:让模型真正学会“看图思考”,而不是“蒙答案”
视觉语言模型(VLMs)存在视觉幻觉和语言捷径问题,限制其可靠性和泛化能力。腾讯提出Vision - SR1训练方法,通过推理分解和自我奖励机制,不依赖外部监督,提升模型视觉感知和推理可靠性。