视觉关键线索」共找到 1673 篇相关文章

开源动态8

月之暗面刚开源多模态Kimi-2506:智能体、视觉理解,重磅大升级

国内月之暗面平台对开源多模态模型Kimi-VL-A3B-Thinking升级到2506版本。该版本性能、视觉理解等能力提升,支持更高分辨率,在多领域表现出色,还介绍了模型组成与优化器改进。

AIGC开放社区
算法论文8

Stream-Omni:同时支持各种模态组合交互的文本-视觉-语音多模态大模型

中国科学院计算技术研究所团队提出文本-视觉-语音多模态大模型Stream-Omni,能支持多种模态组合交互。它对各模态关系针对性建模,实现高效灵活的模态对齐,仅用少量语音数据就有多种交互能力。

机器之心
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极大值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。

机器之心
开源动态8

腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!

腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务中竞争力强,训练分三阶段,相关代码、模型等已开放。

量子位
新闻资讯7

包云岗:不止步于原位替代ARM,开源是RISC-V破局的关键

在全球半导体产业格局重构背景下,RISC-V从边缘走向核心。第五届RISC-V中国峰会举办,包云岗分享其产业应用观察。虽前景好,但RISC-V面临诸多问题,他认为开源是破局关键,还介绍了降成本案例和香山项目。

芯师爷
开源动态8

智谱AI、清华开源新视觉大模型:刷新41项纪录,同级别最强

智谱AI与清华联合开源GLM - 4.5V视觉大模型,它基于GLM - 4.5 - Air开发,架构独特。在42项主流测试中创41项新纪录,多领域表现超Qwen2.5 - VL等模型,还采用新训练策略。

AIGC开放社区
算法论文8

长思维链里的推理步骤,哪些最关键?三招锁定LLM的「命门句子」

杜克大学和 Alphabet 研究者提出在句子层面分析推理痕迹,找出长思维链中关键步骤,提高 LLM 可解释性等。提出三种互补方法,还提供开源工具,研究为调试推理失败等提供可能。

机器之心
算法论文8

英伟达港大联手革新视觉注意力机制!GSPN高分辨率生成加速超84倍

香港大学与英伟达联合推出广义空间传播网络(GSPN)。它采用二维线性传播与“稳定性 - 上下文条件”,将计算量降低,保留图像空间连贯性。在多视觉任务刷新性能纪录,如高分辨率生成加速超84倍。

量子位
新闻资讯8

量子位专访楼天城:AI是匹脱缰野马,Harness是这个时代最关键的能力

量子位专访小马智行CTO楼天城,他认为AI如脱缰野马,Harness是关键能力。小马智行发布PonyWorld世界模型2.0,人类不再是中心,AI成总教练,能自我诊断和定向进化,还探讨了诸多自动驾驶及AI相关问题。

量子位
算法论文8

VLA大模型做长任务总断片?同济KC-VLA用关键帧链给治好了

VLA大模型记性是短板,处理非马尔可夫任务常束手无策。同济大学等提出KC - VLA框架,用关键帧链接赋予机器人全局时间感知能力,还构建了长时序记忆依赖基准测试,实验显示其性能优越。

PaperAgent