多模态知识图谱」共找到 1413 篇相关文章

算法论文8

图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理

华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。

机器之心
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。

深度学习自然语言处理
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极大值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。

机器之心
开源动态8

港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?

香港科技大学(广州)联合腾讯AI平台部提出VibeWorlding,是可通过多轮对话等自主构建和编辑交互式3D世界的多模态智能体框架。团队开源多项数据,其模型经强化学习后表现超GPT - 5.5等。

机器之心
产品应用8

Claude Opus 5 发布:Fable 5 一半的价格,更强的编码能力

Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 相同,价格是 Fable 5 的一半。它在编码、知识工作和推理上表现出色,虽有不足,如速度慢、幻觉率较高,但提供多种 effort 等级,成本低,安全对齐性好。

AI工程化
算法论文8

重写手机AI安全边界!首个MoAI攻防SoK,系统梳理三大安全支柱

墨尔本大学等联合发布论文指出,移动端AI硬件和模型发展使MoAI成重要范式,但带来安全风险。论文给出统一框架,拆解系统为四层,定义三大安全支柱,梳理攻击、防御图谱等,还提出开放问题与未来方向。

新智元
产品应用8

把视频变成图文博客:Agent + 豆包 Seed2.0 lite 重做 Karpathy 两年前的工作流

本文以重做 Karpathy 两年前工作流为例,介绍用 Agent + 豆包 Seed2.0 lite 将视频转为图文博客的方法。详述四步流程,指出其局限,还说明该模式可用于竞品直播追踪、在线课堂报告、游戏赛后复盘等场景。

宝玉AI
开源动态8

突破视觉仿真算力瓶颈!新一代具身智能仿真框架开源:高吞吐并行高保真渲染助力规模化训练

具身人工智能向以视觉为中心转型,但面临“看得真”和“训得快”难题。清华大学智能产业研究院等提出GS - Playground通用多模态仿真框架,融合高吞吐量并行物理仿真与高保真视觉渲染,成果被RSS 2026录用,将开源。

量子位
开源动态8

Kimi K2.5登顶开源第一!15T数据训练秘籍公开,杨植麟剧透K3

Kimi K2.5登上Hugging Face热榜榜首,下载超5.3万。它主打Agent能力,成绩超GPT - 5.2等闭源模型,性价比高。官方技术报告公开其用15T数据训练,还搭载Agent Swarm架构,团队还剧透了Kimi K3。

量子位
产品应用8

DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理了

DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果流机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。

AIGC开放社区