多模态深度调研」共找到 1669 篇相关文章

开源动态8

“甲方快乐模型”诞生,拿下平面设计新SOTA!多条件一键生成,还能独立调整元素 | 复旦&字节

复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、多模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在多维度评估基准上表现出色,还支持多轮编辑。

量子位
开源动态8

阿里通义的视觉RAG革命!VRAG-RL:基于强化学习的视觉感知RAG框架,性能飙升30%

阿里巴巴通义实验室推出VRAG - RL,融合视觉感知、多模态推理与强化学习,已在GitHub开源。它破解传统RAG处理视觉数据难题,通过创新机制提升性能,在多数据集表现出色,还将向更拟人化和低幻觉方向发展。

开源星探
产品应用8

大模型推理的“左右脑”革命!华为盘古Embedded凭昇腾之力,让快慢思考合二为一

传统大模型推理面临长链条深度思考与低时延反馈的矛盾,华为盘古团队提出盘古Embedded模型。基于昇腾NPU,其采用双系统认知架构,集成“快思考”与“慢思考”双推理模式,实现推理效率与精度协同提升。

机器之心
产品应用8

实测字节扣子空间:AI 播客比真人丝滑,Agent 能打 80% 的工

本文对字节跳动旗下 Agent「扣子空间」进行实测。它上线新玩法一键生成播客,相比通用 Agent 能力更丰富。此外,它还具备搜图、深度分析、写代码、开发网站等功能,兼具通用能力与低代码开发特点。

AI科技评论
推荐文章7

多邻国的「AI-first」到底是什么?|AGIX投什么

本文深度访谈多邻国联合创始人及CTO Severin Hacker,探讨其“AI-first”策略。多邻国自成立就确立该理念,AI提升内容创作效率、实现新功能,在运营多方面应用,还分享早期教训、产品策略和团队文化等。

海外独角兽
算法论文8

九成以上模型止步白银段位,只有3个铂金!通用AI下半场评测标准来了

OpenAI研究员姚顺雨提出AI发展步入新阶段,下半场关键在评估模型真实智能。新加坡国立大学等团队提出“通才智能”评测框架,剖析多模态大模型短板,推出五级评估体系和测试集,测试结果暴露模型弱点,引发社区积极反响。

机器之心
算法论文8

从像素空间走向数据流形:生成模型的对抗净化新范式 | TPAMI'26

深度神经网络虽应用广泛,但对对抗样本脆弱,制约可靠部署。本文介绍发表于TPAMI 2026的工作,提出基于一致性模型的对抗净化方法(CMAP),实验表明其在不同场景下鲁棒性强,为对抗防御提供新视角。

量子位
新闻资讯8

李飞飞团队发布新一代世界模型Atlas:从零训练,一次性打通视频生成、 3D重建与机器人仿真

李飞飞创办的 World Labs 发布新一代世界模型 Atlas,称其为‘全球首个多模态世界模型’。它从零训练,能同时完成视频生成、3D 重建和时空模拟,已向少数伙伴开放测试,未来将成 Marble 底层模型。

DeepTech深科技
算法论文8

揭秘 | 桥梁缺陷检测新突破:模型压缩42%,精度几乎不掉

全国公路桥梁超百万座,传统人工巡检效率低且有安全风险,现有深度学习检测模型体积大、计算量高。研究团队提出LBSD - YOLO网络,通过创新实现轻量化,实验显示模型瘦身但性能不减,有重要应用价值。

机器学习AI算法工程
算法论文8

GCEA-YOLO:给油田装上"防火眼",把抽烟行为检测精度拉高 20.8%

油田抽烟事故损失大,传统检测方法有局限,深度学习模型也面临难题。作者基于YOLOv11n构建GCEA - YOLO网络,含ADown、CSP - EDLAN、GFPN、EfficientHead四个模块,检测精度显著提升,还验证了泛化与稳定性,并给出复现代码。

机器学习AI算法工程