混元图像2.0模型」共找到 8778 篇相关文章

开源动态8

北大提出首个复数大模型,2比特量化,推理仅加法,可手机部署!

北大团队提出iFairy方案,将模型权重量化到复数集合,用2比特表示,压缩至原本1/8。推理仅需加减或交换数据位置,成本更低。Transformer架构“复数化”,iFairy模型PPL降10%,性能反超全精度,相关成果已开源。

量子位
算法论文8

√N并行+84倍计算加速!英伟达港大全新图像注意力:空间结构都保留

英伟达、港大等研究人员提出新型视觉注意力机制GSPN,通过线性扫描和稳定性 - 上下文条件处理图像空间结构,降低计算复杂度至√N量级,在多视觉任务达先进水平,生成16K图像加速超84倍。

新智元
新闻资讯8

VAST完成5000万美元A轮融资,加速构建世界模型与UGC互动内容平台

通用人工智能公司 VAST 完成 5000 万美元 A 轮融资,由阿里、恒旭资本联合领投。该公司在 3D 领域成果显著,发布全新 AI 3D 大模型家族,还将重点投入世界模型研发和 UGC 互动内容平台建设。

机器之心
新闻资讯7

Claude Opus 4.1代码实测惊人!OpenAI开源模型却只会写屎山?

昨日,OpenAI、谷歌和Anthropic等发布新模型。Anthropic推出Claude Opus 4.1,虽性能提升不大,但编码能力获大客户认可。实测显示Claude - Opus - 4.1写代码稳,OpenAI新模型表现不佳。

新智元
开源动态8

语音界Sora!微软刚开源新模型,一次生成90分钟语音、3200倍压缩率

今天凌晨微软研究院开源创新音频模型VibeVoice - 1.5B,有诸多技术突破,如可合成90分钟语音、支持4名发言人、3200倍音频压缩等,还首创双tokenizer协同架构。未来微软还会开源更大参数模型

AIGC开放社区
算法论文8

让扩散模型「可解释」不再降质,开启图片编辑新思路

过去三年扩散模型席卷图像生成领域,但可解释性研究是‘黑箱’,且现有尝试常致性能下降。香港中文大学与上海人工智能实验室团队提出TIDE框架,可解释且不降质,还带来新图像编辑方式。

机器之心
算法论文8

数学推理热潮下的冷思考!如何训练真正"全能"的推理模型

论文评估20余个开源推理模型在多领域表现,发现多数模型数学成功难迁移。揭示微调方法(RL vs SFT)决定能力泛化,SFT像‘填鸭’,RL似‘思维健身’,为构建通用推理智能体提供新路径。

深度学习自然语言处理
推荐文章8

5 分钟搞懂开源大模型选型核心维度,16G显卡也能选对

文章以作者自身经历引入,指出开源大模型选型易陷入‘越大越好’误区。讲透选型4个核心维度,含实操步骤与避坑指南,还介绍选后评估方法,助新手快速锁定适配模型

机器学习AI算法工程
算法论文8

dLLM的「Free Lunch」!浙大&蚂蚁利用中间结果显著提升扩散语言模型

近年来,扩散大语言模型(dLLM)成为文本生成新势力,生成效率高。但现有解码策略忽视中间迭代信息,研究团队观察到「先对后错」现象,提出 TCV 和 TCR 方法,显著提升模型在推理任务表现。

机器之心
开源动态7

刚刚,马斯克开源Grok 2.5:中国公司才是xAI最大对手

马斯克主导xAI正式开源Grok 2.5,Grok 3将半年后开源。Grok可在HuggingFace下载,运行有条件。虽Grok 2曾有不错表现,但网友对其参数权重、开源协议等有诟病。此外,还更新APP视频生成功能,马斯克称中国公司是xAI最大对手。

量子位