连续扩散语言模型」共找到 1394 篇相关文章

算法论文8

40倍推理加速!复旦&微软:用「非线性流」拟合复杂轨迹,2步生成媲美原画

ArcFlow是复旦与微软提出的图像生成加速方案,引入非线性流拟合复杂轨迹。它在仅2步推理下保持画质,实现约40倍推理加速和4倍训练收敛加速,微调极少参数,在多模型验证效果出色。

量子位
算法论文8

清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026

语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为长上下文研究提供新思路。

AI科技评论
算法论文8

模型「漂移」新范式,何恺明新作让生成模型无须迭代推理

训练生成模型复杂,传统扩散模型训练费时费力。何恺明团队提出「漂移模型」新范式,不依赖微分方程,支持一步推理,实验验证其在多领域性能佳,有望解决生成式AI质量与效率权衡问题。

机器之心
推荐文章7

「特工宇宙」2025 年度 AI 应用榜单

2025 年是 Agent 元年,语言等模型迭代催生应用新机会。「特工宇宙」与观猹团队合作推出 2025 AI 应用榜单,关注用户体验,列出如 Aivilization、Ima.copilot 等 10 个华人团队的 AI Native 产品。

特工宇宙
产品应用7

阿里通义发布Z-Image非蒸馏版基础模型版本,支持完整CFG和负向提示

阿里通义发布Z-Image基础图像生成模型,采用单流扩散Transformer架构,具核心创新技术。它是非蒸馏模型,支持完整CFG和负向提示,注重输出多样性和创意控制,已在Hugging Face开放下载。

AI工程化
算法论文8

MIT这篇RLM论文,给出了Scaling的另一种可能~

当大家普遍认为解决长上下文问题要靠扩大模型上下文窗口时,MIT 最新的 RLM 论文提出新路径。其 code 已开源,能实现无界上下文处理,可让任意大语言模型处理 10 万 +token。

PaperAgent
开源动态7

干掉延迟!12G显存就能实现实时AI换脸直播,开源免费。

推荐开源项目PersonaLive,它是基于自回归流式扩散技术的实时人像动画生成框架。能平衡画质与低延迟,用一张照片在普通显卡实现数字分身实时驱动,有低显存、无限时长等特点。

开源AI项目落地
新闻资讯7

连肝36小时不睡!00后天才工程师,瘫坐特斯拉靠FSD保命

xAI工程师Parsa Tajik连续工作36小时后瘫坐特斯拉发X平台,同事纷纷叫好,马斯克也回应。xAI秋天忙碌,此前有裁员等情况。Tajik回应网友担忧,称拼车靠FSD安全回家。

新智元
算法论文8

“坏”数据让模型更“好”?重新审视数据过滤

传统观点认为大型语言模型预训练应过滤“坏数据”,但论文《When Bad Data Leads to Good Models》提出反直觉观点,适度加入有毒数据,通过后训练技术可降低模型毒性,保持一般能力,挑战常规做法。

深度学习自然语言处理
算法论文8

强化学习+大模型记忆:Mem-α,让智能体第一次学会“如何记忆”

在大语言模型发展中,‘记忆’是智能体具备长期智能的关键。现有外部记忆系统有局限,Mem-α将强化学习引入大模型记忆管理体系,解决记忆难题,在性能、泛化等多方面表现出色。

机器之心