全模态统一建模」共找到 815 篇相关文章

算法论文8

Apple发布新SOTA Manzano:混合Tokenizer破解多模态统一难题,理解与生成双翼齐飞

模态AI前景广,但现有模型在理解和生成任务上存在性能冲突。苹果提出Manzano模型,用混合视觉标记器降低任务冲突,结构简单可扩展,在多基准测试达SoTA水平,还展示图像编辑潜力。

深度学习自然语言处理
算法论文8

从「时域建模」到「频域融合」:中山大学团队为传感器人体活动识别提供新思路 | TPAMI 2026

中山大学团队在IEEE TPAMI发表研究,用“三重频域融合”(TSF)框架突破传感器人体活动识别(HAR)领域核心瓶颈。该框架从三个全新“视角”审视问题,经多数据集评估表现出色。

AI科技评论
算法论文8

ICLR 2026 | LongHorizonUI:让 GUI 智能体不再"半途而废"——面向长链路任务的统一鲁棒自动化框架

近年来,基于多模态大语言模型的GUI智能体在自动化操作上虽有进展,但任务步数超10 - 15步时成功率断崖下跌。研究人员提出LongHorizonUI框架,构建LongGUIBench评测基准,推动GUI自动化在复杂场景落地。

机器之心
算法论文8

全图与切片并非等价?LLaVA-UHD-v3揭示差异推出高效全图建模方案

随着多模态大模型发展,处理高分辨率图像成关键。主流视觉编码范式难兼顾性能与效率,清华和中科院团队发布 LLaVA-UHD v3,提出 PVC 框架,对比 SBE 和 GNE,验证其在提升效率同时保留模型能力。

机器之心
开源动态7

详解Github 35K+项目:打通200+数据源,构建企业级AI的数据统一入口,支持MCP【下篇】

本文继续介绍MindsDB这款开源AI数据引擎,阐述知识库与混合检索应用,如创建向量索引、语义检索、多源混合检索等;还提及RAG与数据智能体,包括构建RAG管道和配置Data Agent;最后给出应用建议,称其适合复杂企业环境。

AI大模型应用实践
产品应用8

刚刚,奥特曼放出ChatGPT「统一智能体」!惊呼真AGI,最卷打工人来了

奥特曼带队直播发布ChatGPT agent,它融合三大技术优势,可自主工作,还能上网直出PPT、Excel。在多项测试中刷新SOTA,2025年将成全新AI杠杆,解锁「超级个体」模式。

新智元
算法论文8

CVPR2025视频生成统一评估架构,上交x斯坦福联合提出让MLLM像人类一样打分

Video-Bench视频评估框架由上海交通大学、斯坦福大学等团队提出,能让MLLM像人一样评估视频。它构建双维度评估框架,引入链式查询和少样本评分技术,突破现有评估方法限制,更全面智能地评分。

量子位
算法论文8

视觉领域的GPT-3时刻!DeepMind首次证明Veo3模型实现对物理世界建模和推理

谷歌DeepMind研究团队论文显示,视频模型Veo 3学会‘无师自通’,能处理多种没学过的视觉任务。研究人员将其能力分四级,还做了定量评估。研究认为机器视觉或正处范式转变边缘。

AIGC开放社区
产品应用8

创业一年后,李飞飞推出首款可商用世界模型 Marble,任意模态都可生成 3D 世界

李飞飞创业公司 World Labs 推出可商用世界模型 Marble,支持多模态输入,生成的 3D 世界更丰富细致。李飞飞认为空间智能是 AI 下一个前沿,当前 AI 在这方面能力不足,而 Marble 正推动其发展。

Founder Park
算法论文8

模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作

北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。

机器之心