分组查询注意力」共找到 291 篇相关文章

算法论文8

AI自己给自己当网管,实现安全“顿悟时刻”,风险率直降9.6%

大型推理模型有安全风险,此前监督微调泛化能力有限。SafeKey团队提出创新的SafeKey框架,发现大模型信息“越狱”两大核心,通过双通路安全头和查询遮蔽建模强化模型安全,实验验证其有效性。

量子位
算法论文8

最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代

人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。

机器之心
算法论文8

大模型是否对问题难度有预判?最新研究揭示 LLM 内部的“难度感知机制”

近期论文《Probing the Difficulty Perception Mechanism of Large Language Models》系统性解答大模型能否感知问题难度等问题。研究基于数据集在主流 LLM 上训练轻量线性探针,定位负责难度感知的注意力头,还发现不同模型表现有差异。

深度学习自然语言处理
算法论文7

高效大规模创新3D重建模型iLRM

多数基于Transformer架构的模型处理多视图输入有可扩展性问题,成均馆大学、延世大学研究人员提出创新3D重建模型iLRM。它通过迭代细化机制生成3D高斯表示,有独特架构设计和高效注意力机制。

AIGC开放社区
开源动态8

万亿参数狂欢!一文刷爆2025年七大顶流大模型架构

文章深入剖析2025年顶级开源模型的创新技术,介绍了DeepSeek V3/R1、Kimi 2、Qwen3等七大顶流大模型架构,揭示滑动窗口注意力、MoE和NoPE如何重塑效率与性能。

新智元
算法论文8

73%人类认同率!Video-Bench实现视频质量精准打分

上海交大等团队提出视频评估框架Video - Bench,让多模态大模型‘像人一样评判视频’。它构建双维度评估框架,引入链式查询和少样本评分技术,与人类判断73%高相关,为视频生成模型优化提供标尺。

深度学习自然语言处理
算法论文8

ICCV 2025|训练太复杂?对图片语义、布局要求太高?图像morphing终于一步到位

图像处理中‘图像morphing’常见又有创意,但以往技术有训练复杂等问题。南洋理工大学等团队提出FreeMorph方法,无需训练实现图像变形,通过改进注意力机制解决特征丢失和过渡不连贯问题,实验效果佳。

机器之心
推荐文章7

8种LLM架构设计大比拼:从 DeepSeek-V3 到 Kimi K2,究竟有啥不同

文章对比了8种LLM架构设计,如DeepSeek-V3、OLMo 2等。介绍各模型关键技术,像DeepSeek-V3的多头潜在注意力和混合专家架构,还分析不同设计对性能、效率的影响,助读者了解LLM架构差异。

CourseAI
新闻资讯7

Telegram创始人搞了个狠活:100%隐私的去中心化AI网络

Telegram创始人帕维尔·杜罗夫推出专注机密AI计算的去中心化网络Cocoon,或终结中间商垄断。它基于TON区块链,有三层架构,四步完成AI查询,但面临延迟和竞争挑战,未来将采用DAO治理。

AI工程化
算法论文8

CVPR2025视频生成统一评估架构,上交x斯坦福联合提出让MLLM像人类一样打分

Video-Bench视频评估框架由上海交通大学、斯坦福大学等团队提出,能让MLLM像人一样评估视频。它构建双维度评估框架,引入链式查询和少样本评分技术,突破现有评估方法限制,更全面智能地评分。

量子位