视觉语言融合」共找到 2042 篇相关文章

新闻资讯7

AI赋能创新玩法点燃星际热浪,2025星际争霸2锦标赛冠军出炉!

近日,2025星际争霸2锦标赛总决赛结束。赛事有全新种族加入、视角移动功能增加等创新,玩法和观赛体验升级。经多轮比拼,XingMing击败caonima夺冠,赛事重塑玩家与游戏关系。

AIGC开放社区
推荐文章8

刚刚,商汤内部两万字复盘曝光:多模态通往AGI核心路线首次公开

商汤科技联合创始人林达华撰写万字长文,剖析将「多模态通用智能」视为技术战略核心引擎的原因,探索组织及战略层面的思考。文章回顾商汤多模态之路,探讨多模态通向AGI的原因、构建路径等关键问题。

新智元
新闻资讯8

2025 WAIC落幕,深谋科技异军突起,以技术与落地破局具身智能赛道

2025 WAIC落幕,深谋科技作为精英合作伙伴首次亮相,未随波逐流,而是切入脑控、动态视觉伺服和康养场景三大底层能力领域,开拓创新赛道。其产品已商用部署,吸引众多媒体关注。

AI科技评论
算法论文8

ICML 2025 | 多智能体的ChatGPT时刻?上交MAS-GPT实现工作流一键生成

上海交通大学等机构推出 MAS - GPT,提出生成式 MAS 设计范式,可一键生成可执行的 MAS。它解决了现有 MAS 方法无适应性、成本高、泛化性低等问题,实验显示其表现出色,未来潜力大。

机器之心
开源动态8

谷歌开源Gemma 3n:2G内存就能跑,100亿参数内最强多模态模型

本周五凌晨,谷歌正式发布、开源全新端侧多模态大模型 Gemma 3n。它有多模态设计、专为设备端优化等特性,核心是 MatFormer 架构,还采用了 PLE 技术等,在多方面实现质量提升。

机器之心
8

一天 15k 星,代码生成碾压 Claude,连 Cursor 都慌了?谷歌 Gemini CLI 杀疯了

谷歌发布 Gemini CLI,有慷慨免费使用配额,开源且不到一天获 15.1k 星。它连接 MCP 服务器,具备 Agentic AI 能力,接入 Gemini 2.5 Pro 模型,在代码生成等方面表现出色,谷歌认为通用模型更优。

AI前线
算法论文8

LLM进入「拖拽时代」!只靠Prompt,几秒定制一个大模型,效率飙升12000倍

新智元报道,NUS、UT Austin等机构研究人员提出「拖拽式大语言模型」(DnD),它基于提示词生成模型参数,无需微调适应任务,效率最高提升12000倍,零样本泛化能力出色。

新智元
算法论文8

ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示大模型如何“踩雷”领域指南规则

这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示多数主流大模型指令遵循能力不佳,尤其数学推理挑战大,为模型迭代提供评估基准。

深度学习自然语言处理
开源动态8

论文秒变海报!开源框架PosterAgent一键生成顶会级学术Poster

本文介绍开源框架PosterAgent,它能一键将论文转为可编辑的学术海报。相比GPT - 4o,其生成指标优、token使用量少、成本低。研究团队构建评估标准Paper2Poster,实验显示PosterAgent在多方面表现出色。

量子位
产品应用8

波士顿动力机器人进厂打工现逆天操作!3D感知+实时追踪,人类捣乱完全不带怕的

波士顿动力的Altas机器人重磅升级,具备3D空间感知和实时物体追踪能力,可自主执行复杂工业任务。文章还解析其背后技术,包括2D感知、3D感知、物体位姿估计和校准等,团队未来将构建统一基础模型。

量子位