「掩码扩散语言模型」共找到 1311 篇相关文章
全球开源大模型,前十五名全是中国的
近日,随着新一代大语言模型更新,开源大模型成热门话题。Design Arena排行榜上,若设定为“开源”,前15名均为国产开源大模型,排名第一的是DeepSeek - R1 - 0528 ,智谱、阿里等厂商多款模型上榜。
谢赛宁团队新作:不用提示词精准实现3D画面控制
谢赛宁团队新发布的Blender Fusion框架,结合图形工具 (Blender) 与扩散模型,让视觉合成不再仅依赖文本提示,实现精准画面控制。其核心是对现有技术高效组合,还透露两项训练技巧提升泛化性。
狂揽33.8K星!这款Postman替代工具,绝了,离线+Git协作太香
Bruno是开源API探索测试IDE,有自研Bru语言、离线存储和Git协作能力,是Postman等强力竞争者。它功能丰富,有跨平台支持等,技术架构优势明显,还给出实战演示和同类工具对比。
华为诺亚发布ScaleNet:模型放大通用新范式
华为诺亚方舟实验室等团队提出 ScaleNet 方法,创新性地用少量额外参数量将模型深度扩展一倍。结合层级权重共享和轻量级适配器技术,在视觉和语言任务上验证了有效性,提升了模型性能。
惊艳!GitHub 开发者一键接入!4.2k star 项目 Champ,用一张照片秒变动画
Champ项目致力于从一张静态人物图生成人体动画,将3D参数化人体模型引入扩散模型。它解决了传统动画效果不真实等痛点,有诸多核心功能,技术优势明显,在多领域有高应用价值。
大模型时代,通用视觉模型将何去何从?
过去通用视觉模型(VGM)是研究热点,想实现‘视觉模型大一统’。但大语言模型发展使研究热点转移,视觉‘独立性’被重新定义。清华鲁继文团队综述梳理其进展,探讨现状、挑战与应用潜力。
面壁小钢炮 VoxCPM-TTS:开源端到端 TTS,轻量高效低延迟
面壁提出基于扩散自回归建模的端到端语音生成模型 VoxCPM,构建于 MiniCPM - 4 之上。它克服传统离散 token 方法缺陷,实现语义与声学特征解耦,有上下文感知语音生成和零样本语音克隆能力,低延迟。
GPT-5系列咋都爱说「哥布林」?原因找到了
OpenAI发布博客解释模型迷上「哥布林」的原因。原来是训练“Nerdy”人格时,奖励信号偏爱怪物词汇,强化学习将风格固化并扩散到普通对话。此前DeepSeek V3.1也出现过「极」字Bug。
我宣布,这就是现在人声最真实的AI音乐模型。
作者体验Minimax新推出的音乐模型Music 2.5,称其真实感强,中文无敌,咬字清晰,能唱维语等多语言。搭配粉丝开发的小工具,可尝试多种曲风,价格实惠,但功能有待完善。
多模态推理新范式:上海AI Lab新作证明“画”出答案比“说”出答案更靠谱
上海人工智能实验室等联合提出DiffThinker模型,利用扩散模型构建全新视觉推理范式。它在视觉中心任务上表现优异,准确率碾压GPT - 5等模型,还能与MLLM协同推理实现1 + 1 > 2的效果。