结构化图像生成」共找到 2810 篇相关文章

算法论文7

The Batch: 931 | 统一视觉媒体的单一分词器

Apple团队开发多维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经多阶段训练,在多任务上达或接近先进水平,为视觉模型带来通用性。

DeeplearningAI
新闻资讯8

Nature重磅:智能的尽头是算力!谷歌大佬承认「预测下一个词即智能」

芯片速度触顶,摩尔定律失效,但AI却在疯狂跃迁。Nature文章指出,智能的增长不靠芯片加速,而是结构重组与协作。其核心是预测和并行协作,AI正以类似生命演化的方式发展,与人类相互依存。

新智元
算法论文8

ACL 2025预定爆款!HyperGraphRAG横扫5大领域,检索效率提升7倍

文章聚焦HyperGraphRAG模型,介绍其架构由知识超图构建、超图检索策略、超图引导的生成机制组成,阐述构建步骤,该模型能提升检索效率,或成ACL 2025爆款。

CourseAI
开源动态8

告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式

传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。

机器之心
开源动态8

Claude团队打开大模型「脑回路」,开源LLM思维可视化工具来了

Claude团队推出“电路追踪”工具,可生成归因图呈现LLM处理信息路径,支持在主流开源权重模型上快速生成。研究人员能借此解码LLM“决策逻辑”,官方还给出多语言电路等示例。

量子位
算法论文7

HOIDiNi:一句话驱动虚拟人高精度操作物体

特拉维夫大学提出HOIDiNi,这是文本驱动的扩散框架,用于生成人体 - 物体交互动作。它引入扩散噪声优化,能兼顾真实感与物理正确性。不过它泛化能力待拓展、生成速度慢,未来需提升效率等。

带你学AI
开源动态8

当世界模型不止「视频」该如何评估?WorldLens提出实用化评估新框架

生成式世界模型在多领域进展显著,但评估存在局限。WorldBench 团队构建 WorldLens 评测框架,从五个维度评测开源世界模型,其评测 EvalKit 已公开,可暴露模型能力边界与失效模式。

机器之心
产品应用8

小米AI语音新框架:人人都能当声音导演

小米大模型应用团队提出Midasheng - audio - generate与Xiaomi Any2Speech两大音频生成框架。前者可实现全场景声音重建,后者让AI学会理解声学空间与叙事逻辑,改变了语音合成应用场景与思路。

量子位
产品应用8

MiniMax秀了波AI视频杂技:越看越惊艳,指令遵循太强了

MiniMax发布海螺2.0版本,能处理极端物理情况,原生支持1080P,在指令遵循、生成质量达一流水平,成本效率破纪录。此前还开源MiniMax - M1,两大底层技术创新让其成果惊艳,展现研发实力。

量子位
新闻资讯7

DeepSeek V3.1 突发离谱「极」字Bug的原因找到了~

DeepSeek V3.1被曝恶意漏洞,生成文本时会突然插入“极”字。该漏洞在第三方API平台和官方Playground均有出现,可能因数据集“污染”或模型“偷懒”,严重影响高精度场景。

PaperAgent