语义条件」共找到 313 篇相关文章

算法论文8

英伟达港大联手革新视觉注意力机制!GSPN高分辨率生成加速超84倍

香港大学与英伟达联合推出广义空间传播网络(GSPN)。它采用二维线性传播与“稳定性 - 上下文条件”,将计算量降低,保留图像空间连贯性。在多视觉任务刷新性能纪录,如高分辨率生成加速超84倍。

量子位
新闻资讯7

Vector数据库退位,AI记忆Memvid登场!

近期基于视频的AI记忆库Memvid大火,宣称革新AI记忆管理,能将文本片段存于MP4实现快速语义搜索。不过网友分析,它底层用FAISS,读写慢、文件大,仓库issues也显示其性能与声称相反。

PaperAgent
算法论文8

无需训练,如何提升黑箱VLM?CARPRT用「类别感知」给出答案

近年来,视觉 - 语言模型(VLMs)改变图像理解范式,但零样本分类性能对 Prompt 敏感。墨尔本大学 TMLR 小组提出 CARPRT 方案,以“无训练、黑箱适配、类别专属权重”解决提示词语义适配不足问题,已被 ICLR 2026 接收。

机器之心
算法论文8

上海交大DENG Lab提出「LatentUM」:Unified Model的真正「战场」在视觉推理与世界模型

上海交通大学 DENG Lab 提出的 LatentUM,尝试让统一模型把生成的视觉内容纳入推理闭环。它在多项任务上超越基线,其核心思路是生成与语言共享语义空间的离散 visual semantic tokens,模型含三大关键设计。

机器之心
开源动态8

工业级 LLM 数据工程:北京大学 DCAI 团队 DataFlow 框架的架构设计与实践

2026 年大模型研发从‘模型中心’向‘数据中心’演进,数据语义密度与工程精度成突破关键。北京大学 DCAI 团队推出 DataFlow 框架,解决数据准备难题,其技术报告登顶 Hugging Face。该框架有多种特性,实验验证其能提升模型性能。

InfoQ
算法论文8

北大大牛团队最新顶会,首次让AI能够生成真实火焰

北京大学陈宝权教授团队提出 FieryGS 框架,被 AI 顶会 ICLR 2026 接收。它将多模态大模型、燃烧物理仿真与 3D 高斯溅射融合,首次在 3D 重建中实现物理可信、语义感知且可控的火焰合成,推动数字孪生发展。

新智元
开源动态8

给Agent装上“海马体”!上海AILab开源MemVerse,定义多模态记忆新范式

上海人工智能实验室开源MemVerse,这是首个面向智能体的通用多模态记忆框架。它将多模态信息与文本对齐到统一语义空间,首创‘双通路’架构与‘记忆蒸馏’技术,让智能体有终身记忆能力,在多模态任务中表现出色。

量子位
产品应用8

MV导演诞生!上海巨人网络用让AI听懂音乐并掌镜拍摄MV

上海巨人网络AI实验室提出YingVideo - MV框架,结合音乐语义分析、镜头规划与视频生成模型,解决传统音频驱动视频生成难题。它分两步生成视频,以MV导演模块统筹,还解决长视频连贯性等问题,性能优于同类模型。

AIGC开放社区
算法论文8

用两个简单模块实现分割理解双重SOTA!华科大白翔团队等推出多模态新框架

华中科技大学和金山办公团队联合提出语义增强特征提取器(SEFE)和交错局部视觉耦合(ILVC)模块,构建多模态大模型LIRA,解决现有模型分割不精确和理解有幻觉问题,在分割和理解任务上达SOTA。

量子位
算法论文8

ECCV 2026 | 北大团队提出 Atomic Dance:基于原子动作的可解释音乐舞蹈生成框架

北大团队提出 Atomic Dance 框架,以原子动作作为舞蹈基本单元,建立有明确语义和结构的舞蹈表示,设计“动作规划 — 舞蹈生成”两阶段框架,让生成的舞蹈更符合音乐节奏和编舞逻辑,具备可解释性和可编辑性。

机器之心