视觉语言融合」共找到 2040 篇相关文章

算法论文8

75页哈工大多模态推理大模型最新综述:感知、推理、思考与规划

哈工大提出75页多模态推理大模型综述,围绕四阶段发展路线图展开,即感知驱动的模块化推理、以语言为中心的短推理、以语言为中心的长推理、迈向原生多模态推理模型,还给出挑战性基准测试和实验案例见解。

PaperAgent
开源动态8

以小博大!Nanbeige4-3B重磅开源:硬刚Qwen3,挑战小模型能力新高度

近年来大语言模型参数膨胀,成本升高,业界重注小语言模型。近日,Boss直聘南北阁大模型实验室发布仅30亿参数的Nanbeige4 - 3B,在多方面媲美甚至超越通义千问Qwen3系列模型,开源印证小模型潜力。

AIGC开放社区
开源动态8

开启端侧长文本时代!面壁全新架构,让小钢炮最快提升220倍

2025智源大会上,面壁智能发布MiniCPM 4.0模型,实现行业首个系统级上下文稀疏语言模型创新。它在端侧推理任务上表现出色,降低缓存需求,提高运行效能,还进行多维度架构创新,是AI领域探索高效率语言模型的里程碑。

机器之心
推荐文章8

当EDA(消息驱动架构)遇到AI Agent:消息驱动在智能体时代的重生

文章探讨消息队列与AI Agent的融合。回顾消息队列发展历程,阐述多智能体协作系统成为AI落地核心架构的原因,分析消息队列与AI Agent的融合点,介绍Apache Pulsar对AI Agent的赋能,还展望了AI与中间件的双向进化。

AI大模型应用实践
开源动态8

重磅!华为开源业界首个Serverless分布式计算引擎openYuanrong,单机体验编程、极致分布式运行性能

近期,华为开源自研的 Serverless 分布式计算引擎 openYuanrong,它是业界首个统一支持通算和智算场景的开源引擎。能解决传统 Serverless 产品通用性不足等问题,已在华为多个核心产品应用,提升了开发效率和资源利用率。

InfoQ
推荐文章7

智能流体力学专题研讨会特邀报告3|边鑫:混合深度学习与迭代方法的粘性不可压流动加速求解

2026年8月,第十四届全国流体力学学术会议在青岛举行,智能流体力学专题研讨会展示了人工智能与流体力学交叉领域进展。边鑫作《混合深度学习与迭代方法的粘性不可压流动加速求解》报告,介绍HyDEA求解框架。

力学与人工智能
开源动态8

3万小时触觉数据补齐具身智能“手感”!新智具身&复旦大学技术报告三连发

上海新智具身联合复旦发布三份技术报告,将触觉跃升为具身智能核心基建。包含统一触觉数据格式并构建3万小时语料库、以触觉预判赋能VLA、在世界模型重构触觉想象等内容,项目数据和模型将开源。

量子位
开源动态7

OpenAI开源Privacy Filter:PII检测不用传服务器 Apache2.0可商用

OpenAI开源Privacy Filter模型,采用Apache2.0协议可免费商用。它是PII检测工具,支持全本地运行,避免数据泄露。有诸多技术亮点,也有一定局限性,上线后下载量可观。

AI工程化
新闻资讯7

姚顺雨现场颁奖,吉嘉铭、董冠霆等15位青年人才获腾讯「青云奖学金」

腾讯「青云奖学金」在深圳颁奖,首期选出 15 位获奖者,每人获 20 万现金和价值 30 万云异构算力资源。姚顺雨现身颁奖,获奖者有白雨石、陈俊松等青年 AI 学者,各有出色研究成果。

机器之心
产品应用7

腾讯发布WeKnora知识库,无缝链接微信生态

微信团队推出基于大模型的文档理解检索框架WeKnora,应用于复杂异构文档场景。它采用多模态预处理等设计,有文档解析、意图识别等特点,可本地私有化,还能与微信生态无缝衔接。

CourseAI