多模态处理」共找到 1791 篇相关文章

新闻资讯8

工业异常检测新突破,复旦等多模态融合监测入选CVPR 2025

复旦大学等机构联合发布高精度多模态数据集Real - IAD D³,提出多模态融合检测方法D³M,成果被CVPR 2025收录。该数据集含多类数据,提升检测性能,此前相关工作也被CVPR 2024收录。

量子位
产品应用8

AI真有希望考清北了!豆包1.6多模态推理发威,闯关数理化带图大题

火山引擎原动力大会发布豆包大模型1.6,它是国内首款多模态SOTA模型,支持256k上下文长度。实测中它解答高考数理化带图大题表现出色,还具备图像识别、视频理解、GUI操作等能力。此外,火山引擎还推出系列工具和平台助力企业。

新智元
推荐文章8

商汤林达华万字长文回答AGI:4层破壁,3大挑战

在WAIC 2025上,商汤发布国内首个实现“图文交错思维”的商业级大模型日日新6.5。商汤科技联合创始人林达华发文,剖析多模态通用智能实践,解答AI领域关键问题,提供通往AGI的参考。

量子位
产品应用7

奶牛版 Oura 估值 10 亿美金,AI+PDF 让它拿了 1700 万美金融资

市场上多数AI PDF产品是ChatPDF模式,用于C端。企业关键非结构化数据多在PDF等传统载体中,难以获取。硅谷工程师做的Extend AI产品,获1700万美金融资,解决传统文档处理难题,打造平台。

投资实习所
开源动态7

MIDAS:快手可灵发布实时交互式数字人生成框架

近年来交互式数字人视频生成受关注,但实时处理多模态输入有挑战。快手可灵团队提出MIDAS框架,基于LLM驱动的自回归模型,结合轻量级扩散头,实现低延迟、交互式多模态控制,还构建大规模数据集等。

带你学AI
产品应用7

打工人五一自救指南:把活全甩给AI,准备免打扰出门

五一将至,为避免假期工作内耗,可安装百度智能云打造的AI助手DuMate。它支持多模态理解与生成,能跨应用完成复杂任务。经测试,它可高效处理整理文件、生成报告等工作,还能并行处理多项任务。

量子位
产品应用7

GPT-5超越人类医生!推理能力比专家高出24%,理解力强29%

最新研究显示,GPT - 5在医疗领域处理多模态信息能力出色,在多模态测试中推理和理解得分比GPT - 4o分别提高近30%和36%,比人类医生还高。其能力提升源于端到端多模态架构,但现实应用还需更多实战考验。

量子位
新闻资讯7

确认!DeepSeek多模态AI已经开测

DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。

量子位
开源动态8

多模态Qwen3-VL-Embedding开源&技术剖析

互联网内容多元,传统文本搜索引擎应对跨模态需求力不从心。阿里开源Qwen3-VL系列两大模型,Qwen3-VL-Embedding负责“海选”,Qwen3-VL-Reranker负责“决赛”,技术亮点多,实验表现优异。

PaperAgent
产品应用7

GitHub 如何用 AI 重构反馈处理机制

GitHub 引入由 AI 驱动的工作流,将无障碍反馈转化为工程工作。系统基于 GitHub Actions、Copilot 和 Models APIs 构建,集中管理报告、分析合规性、协调问题解决。采用后问题解决比例提升,时间下降。

InfoQ