结构化图像」共找到 1538 篇相关文章

新闻资讯7

Telegram创始人搞了个狠活:100%隐私的去中心AI网络

Telegram创始人帕维尔·杜罗夫推出专注机密AI计算的去中心网络Cocoon,或终结中间商垄断。它基于TON区块链,有三层架构,四步完成AI查询,但面临延迟和竞争挑战,未来将采用DAO治理。

AI工程化
产品应用8

“图片秒生”,腾讯混元图像2.0模型正式发布,主打速度和真实感

5月16日,腾讯发布混元图像2.0模型,率先实现实时生图,生图速度快、质量高,能避免‘AI味’。在GenEval基准上准确率超95%,还发布实时绘画板功能,后续将推原生多模态模型。

AI科技大本营
开源动态7

Glyph:文本转图片解决长上下文困境,智谱把“DeepSeek-OCR”具像

传统 token 扩展方式遇算力成本天花板,DeepSeek 与智谱都想到让 AI“看”文字思路。智谱发布 Glyph 框架工程实现此思路,将文本转图片处理,降低计算成本,有不错效果但也存在排版敏感等限制。

AI工程化
算法论文8

自回归模型杀回图像生成!实现像素级精准控制,比Diffusion更高效可控

当下AI图像生成领域,Diffusion模型虽为主流,但在精准控制上有不足。伊利诺伊大学香槟分校等机构研究者提出MENTOR框架,用自回归模型实现像素级精准控制,比Diffusion更高效可控。

量子位
开源动态8

无需多视角,单图重建可交互3D模型!南洋理工开源结构推理框架

南洋理工大学团队提出MonoArt,将单目可动物体重建建模为渐进式结构推理过程,通过四个关键模块逐步推理,无需外部先验,在PartNet - Mobility基准测试中表现领先,兼顾推理效率,还可用于下游任务。

新智元
新闻资讯7

金融大模型升级决策平台!马上消费发布“天镜”3.0破解经验碎片难题

6月6日“2025消费金融生态大会”在重庆举行,马上消费常务副总经理蒋宁推出全面迭代的“天镜”3.0。它开启从个体到群体智慧跃迁,挖掘隐性经验,能匹配最佳服务路径,还具备协同进能力。

量子位
算法论文8

NTU S-Lab 团队探索可动 3D 新方向:结构、关节、纹理一次到位

南洋理工大学 S-Lab 团队发布研究,提出统一建模框架,能从单张图像生成可动三维对象,在几何精度、外观一致性与运动合理性上显著提升,解决了现有方法的难题,为相关领域发展奠定基础。

AI科技评论
开源动态8

腾讯混元发布并开源图像模型 2.1,支持原生 2K 生图

9月9日深夜,腾讯发布并开源混元生图模型“混元图像2.1”,支持原生2K高清生图,综合能力领先。它在多方面升级,有诸多亮点,评估显示效果优,还同步开源文本改写模型,能满足多样视觉需求。

InfoQ
推荐文章7

看完 Manus、Cursor 分享后的最大收获:避免 Context 的过度工程才是关键

上下文工程优是Agent创业公司新一年竞争重点,其信息质量很大程度决定Agent表现。文章结合Manus、Cursor团队思路,给出做好上下文工程要点,如缩减上下文、搭建工具行动空间、多Agent协作等。

Founder Park
产品应用8

顶级邪修|万字教程|教你速通豆包・图像创作模型 Seedream 4.0

火山引擎上线豆包・图像创作模型Seedream 4.0,支持图片生成、连续编辑等。它美学表现佳、支持中文,企业可通过火山方舟接入,个人今晚20:00可在指定渠道体验。文中还给出多种玩法及对应提示词。

歸藏的AI工具箱