多语义性」共找到 4563 篇相关文章

算法论文8

高保真、控制集成于「统一画布」,组合式图像生成新范式!

Canvas - to - Image是新型图像生成框架,将种控制方式整合到统一画布,用户可直观操作生成高保真、控制图像。它简化创作流程,解决了现有方法控制单一分散、交互差的问题。

新智元
算法论文7

SceneGen: 单图像驱动的资产3D 场景生成

上海交通大学提出SceneGen框架,可从单张场景图像及其对应目标掩码中,同时生成带有几何结构与纹理的个3D资产。它一次前向传播即可完成生成,在效率与稳健上优于现有方法,虽有局限但应用潜力大。

带你学AI
开源动态8

视觉Token注入CLIP语义,走向模态理解与生成新范式

腾讯ARC Lab等机构提出全新视觉分词器TokLIP,将低级视觉Token与高级CLIP语义结合,支持端到端自回归训练,可接入LLM框架,降低计算与数据门槛,在模态任务中表现优异,代码已开源。

量子位
算法论文8

突破单token预测局限!南洋理工首次将token预测引入微调,编程任务准确率提升11.67%

当前主流大语言模型依赖下一token预测训练,难理解跨token完整概念。南洋理工大学提出概念感知微调(CAFT)技术,首次将token预测引入微调,能让模型理解完整概念,领域实验显示其可显著提升模型能。

量子位
产品应用8

证明也有「选择困难症」?腾讯AI Lab与大模型研究部联手打造 MPS-Prover ,视角破解形式化推理瓶颈!

本文聚焦逐步式自动化定理证明器困境,腾讯AI Lab等提出MPS - Prover。它有数据筛选和视角树搜索两项创新,提升搜索效率和证明质量,在基准表现佳,还解决六道IMO难题。

AI科技评论
产品应用8

锁定角色,「主体」也可控!个化文生图,给你PS般交互体验

LayerComposer革新个化图像生成,能让用户如在Photoshop般操控元素位置、大小,解决传统方法交互主体扩展难题。它有分层画布、锁定机制、模型–数据共设计三大特点,实验表现出色,未来将促进人机协同创作。

新智元
新闻资讯8

模型训练最重要的依然是 Scaling —— 对话阿里通义千问 Qwen 语言负责人杨宝嵩 | Open AGI Forum

本文是对阿里通义千问Qwen语言负责人杨宝嵩的专访。他透露Qwen一开始就将国际化视作核心战略,团队建立文化标注体系确保内容安全合规。还谈到语言推理难题及应对策略,认为扩大模型规模和数据量仍重要,合成数据是延续Scaling Law的关键。

AI科技大本营
新闻资讯7

DataBuddy:数据语义驱动的企业 Agent Runtime 设计与落地|AICon 深圳

2026年AICon深圳站8月21 - 22日举办,聚焦关键方向。腾讯彭锦文将分享《DataBuddy:数据语义驱动的企业Agent Runtime设计与落地》,拆解DataBuddy相关架构,还介绍演讲痛点、听众收益等,大会有10个专题论坛。

InfoQ
开源动态8

设计师集体沸腾!阿里开源千问图像编辑模型,支持语义及外观的双重编辑!

阿里Qwen团队于2025年8月18日发布Qwen-Image-Edit模型,基于20亿参数的Qwen-Image模型,结合Qwen2.5-VL和变分自编码器,支持语义及外观双重编辑,能精准修改文字,已上线Qwen Chat等。

开源星探
算法论文8

少量视角也能得到完整3D几何,即插即用的语义增强重建插件来了

现有神经隐式路线在样本稀疏时有跨视角对应不稳等问题。上海交通大学等团队提出SERES,将跨视角语义一致作先验注入模型,以低成本解决歧义问题,在场景提升重建质量。

机器之心