「权重解耦」共找到 263 篇相关文章
AAAI 2026 Oral | 告别注意力与热传导!北大清华提出WaveFormer,首创波动方程建模视觉
北大清华团队在AAAI 2026 Oral论文中提出WaveFormer,首创用波动方程建模视觉。它将特征传播写成欠阻尼波动方程,实现频率 - 时间解耦,在多任务验证中速度、效率与精度全面超越。
Meta开源首个320亿参数代码世界模型CWM
Meta FAIR发布320亿参数的研究模型Code World Model (CWM),用“世界模拟”方式处理代码,试图真正“理解”代码逻辑。它在Math - 500数据集测试成绩亮眼,模型权重开放,可多渠道下载。
编程能力开源SOTA,网络安全提升2倍!智谱发布GLM-5.3
智谱发布GLM-5.3,743B参数模型,编程能力达开源SOTA。网络安全能力涌现,基准得分是GLM-5.2两倍多。全部提升来自后训练缩放,还自研Z.ai Code Bench评估,安全评估加固后权重将开源。
B站发布最强零样本TTS,IndexTTS2情感可控、时长精准
在大规模TTS系统中,自回归模型难精准控制语音时长。Bilibili推出IndexTTS2,支持两种生成模式,实现情感表达与音色解耦,引入GPT潜在表示,设计‘软指令’机制,降低情绪控制门槛。
Thinking Machines再发文:模块化流形让训练更稳定
Mira Murati团队分享神经网络训练推理新研究,提出“模块化流形”让训练更稳定。将权重约束在Stiefel流形,设计Manifold Muon优化器,实验显示效果好,但计算开销和理论问题待解决,代码已开源。
何恺明组三位本科生领衔!持续聚焦Flow模型,突破归一化流生成效率瓶颈
何恺明团队新作聚焦Flow模型,提出双向归一化流(BiFlow)框架,解耦前向与逆向过程,打破传统归一化流生成模型效率低下问题。三位一作是本科生,实验显示其速度和质量表现出色。
让GPU不再摸鱼!清华蚂蚁联合开源首个全异步RL,一夜击穿14B SOTA
清华与蚂蚁联合开源AReaL - boba²,实现全异步强化学习训练系统,解耦模型生成与训练流程,大幅提升GPU利用率。14B模型在多个代码基准测试达SOTA,性能接近235B模型。
MiniMax都在用!5500PB幕后功臣首次亮相,国产黑马祭出杀招
AI浪潮中,数据流不动致GPU算力空转,XSKY星辰天合举办AIMesh产品战略发布会破局。AIMesh含三网,分别解决IO墙、重力墙、内存墙问题,且开放解耦,获多方认可。
刚刚国产双响炮炸场!智谱「牛来模型」和阿里Qwen3.8-Flash双双亮相屠榜
智谱发布GLM - 5.3 - Flash(牛来模型),原生多模态,支持1M token上下文,运行在国产芯片,价格实惠。阿里开源Qwen3.8 - Flash - Next权重,成本低性能优,在四大维度重构架构。
从文心开源谈起,论大模型发展新生态
6月30日百度宣布开源ERNIE 4.5即文心4.5系列模型,实现预训练权重+推理代码完全开源。文心团队提出创新架构,增强多模态理解能力。今晚7:30,CSDN邀专家深度解读文心开源及行业趋势。