视觉鲁棒性」共找到 685 篇相关文章

算法论文8

ICLR 2026 Oral|多模态知识图谱对齐难:破解噪声关联至为关键

在数据多元化时代,多模态知识图谱能为下游应用提供数据支撑,实体对齐是构建知识图谱的核心技术。但大规模知识图谱关联与融合面临噪声和潜隐关联挑战。四川大学团队提出 RULE 方法,缓解了这些影响,论文被 ICLR 2026 接收为 Oral。

机器之心
开源动态8

EmbodiChain开源,用100%生成式数据自动训练具身智能模型

跨维智能开源EmbodiChain,它是通往GS - World的基石,重构具身智能学习范式。其以100%生成式仿真数据训练机器人,突破数据瓶颈,还对比了不同路线,测试显示其模型效果佳。

机器之心
产品应用7

Grab 订阅平台从 SQS 和 Redis 切换到 Temporal

Grab基于Temporal构建新的GrabUnlimited架构,增强用户体验,将订阅平台生产事件减少80%。原架构用SQS和Redis,随订阅者增多问题频出,新架构利用Temporal特性解决诸多难题。

InfoQ
产品应用7

这个 4o 矢量插画提示词效果太好了

该 40 矢量插画提示词效果出色,适合张扬的产品主题插画,色彩一致、线条粗,便于转换成 SVG,还给出了具体提示词内容。

歸藏的AI工具箱
开源动态8

代码、多模态检索全面登顶SOTA!智源BGE向量模型三连击,并全面开放

检索增强技术在代码及多模态场景作用大,向量模型是关键。智源研究院联合高校研发三款向量模型BGE - Code - v1、BGE - VL - v1.5、BGE - VL - Screenshot,登顶多领域测试基准,已全面开放助力研究与应用。

机器之心
产品应用8

上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”

上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。

OpenMMLab
开源动态8

开源SOTA!商汤原生多模态一个大脑完成看图、推理、作画

商汤开源日日新SenseNova U1,用NEO - unify架构让像素和文字自由协作,多项指标达开源SOTA,适配10家国产芯片。它能完成看图、推理、作画等多任务,虽有局限,但后续优化值得期待。

AIGC开放社区
算法论文8

ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案

多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。

机器之心
新闻资讯7

Nano Banana 2突然现身!能画公式解数学题,监控画面都能伪造

Nano Banana 2代以预览版现身第三方网站,后被移除。其能力远超1代,能处理复杂提示,可生成复杂UI、解数学题甚至伪造监控画面。谷歌正将Nano Banana整合进核心产品生态。

量子位
产品应用8

终于有AI视频模型,解决了体操难题。

前天深夜MiniMax发布Hailuo 02视频模型,虽未正式上线但放了预告片。该模型能生成杂技动作,解决了体操难题,在复杂动作肢体表现上吊打其他模型,还支持原生1080P,价格便宜。

数字生命卡兹克