「多模态大语言模型」共找到 8236 篇相关文章

产品应用8

中国AI Agent产业化参考范本:斑马口语攻克的四大技术难关

2025年AI产业转折,通用大模型落地难,垂直场景成关键。斑马口语作为垂直落地的AI Agent,突破实时交互、语音识别、内容适龄、多模态呈现四大技术难关,为中国AI Agent产业化提供范本。

机器之心
新闻资讯7

AI看不懂的色盲测试背后,藏着一场像素与诗意的战争。

作者和同事测试AI色盲测试图,多模态模型Gemini 3 Pro、Claude Opus 4.5等纷纷答错,仅GPT 5.2 Thinking答对且靠代码作弊。研究发现,AI看图断章取义,缺乏人类的“格式塔”能力。

数字生命卡兹克
算法论文8

AI打通第一/第三人称视觉,跨视角视觉理解新SOTA|ICCV 2025 Highlight

INSAIT、复旦大学等联合提出ObjectRelator框架,让AI精准匹配不同视角下同一物体,实现跨视角统一表征与理解。它在Ego转Exo和Exo转Ego任务上超基线模型,已被ICCV 2025接收,代码开源。

量子位
产品应用8

Jina Reranker v3: 全新“列式”重排器,0.6B参数刷新文档检索SOTA

Jina AI推出第三代重排器Jina Reranker v3,在多语言检索基准上刷新SOTA。它参数仅6亿,有“last but not late”交互机制,能一次性处理查询和文档。还提供动态量化格式,方便不同硬件部署。

Jina AI
开源动态8

开源音视频同步SOTA基座:极简的单流架构,2秒出片

AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。

AIGC开放社区
产品应用8

腾讯王者归来:混元图像3.0登顶LMArena!一手实测全球最强图像AI

LMArena最新榜单显示,腾讯「混元图像3.0」在文生图任务中夺冠,碾压谷歌Nano banana和字节Seedream 4。它9月28日开源,性能对标闭源模型,有强大推理、语义理解能力,支持中英文长文本渲染。

新智元
产品应用8

AI不再「炫技」,淘宝要让技术解决用户每一个具体问题

技术发展迅速,淘宝力求将AI融入应用场景解决用户问题。今年3月升级AIGX技术体系,近日郑波公开淘宝全模态大模型进展,认为狭义AGI或5 - 10年到来,多模态智能成关键技术域。

机器之心
算法论文8

IEEE TPAMI 2025 | 北京大学提出LSTKC++,长短期知识解耦与巩固驱动的终身行人重识别

北京大学周嘉欢团队在IEEE TPAMI发布LSTKC++研究成果。该框架引入长短期知识解耦等机制,保障模型学习新知识和记忆历史知识。代码已开源,研究在性能和效率上优势明显,有广泛应用价值和拓展空间。

机器之心
算法论文8

MIT & Google | 提出异步并行生成新范式,LLM推理效率大幅提升!

MIT与谷歌团队在研究PASTA中探索异步生成范式,开发标记语言PASTA - LANG,采用双阶段训练流程,设计推理系统。实验显示PASTA平衡性能与质量,有可扩展性,为LLM推理效率优化开创学习驱动新路径。

AINLPer
新闻资讯7

刚刚,谷歌AI路线图曝光:竟要抛弃注意力机制?Transformer有致命缺陷!

谷歌未来AI路线图曝光,Gemini全模态是重点,模型向智能体转变,推理能力将扩展。谷歌还需突破现有注意力机制限制实现无限上下文。此外,文中盘点了OpenAI、DeepSeek等大厂AI年中表现。

新智元