「参数高效微调」共找到 1419 篇相关文章
1.5B参数!支持本地实时语音转录
Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。
The Batch: 907 | 小而高效模型的“制作”方法
Mistral AI发布Ministral 3系列模型权重,结合剪枝与蒸馏技术,用级联蒸馏法构建。该系列参数规模有140亿、80亿和30亿,在部分测试中表现佳,训练成本低于传统方式。
TreeHop:无需LLM的高效多跳问答新范式
多跳问答(MHQA)任务有挑战,现有方法依赖LLM,计算成本高、延迟显著。TreeHop研究提出新方案,摒弃LLM,通过嵌入空间动态更新,降低延迟、减少模型参数量,还在主流数据集表现佳,适合工业应用。
关于CUTLASS Grouped GEMM中Alignment参数的分析
文章围绕CUTLASS Grouped GEMM的Alignment参数展开。介绍其含义与自然对齐有关,既代表访问粒度也指明地址对齐要求。针对CUTLASS 2.x和3.x API分别阐述设置Alignment的方法及原理,还给出编译期推导代码示例。
刚刚,美团推出 136 亿参数视频生成模型
美团推出 136 亿参数视频生成基础模型 LongCat-Video,采用 MIT 开源协议。该模型覆盖文本、图像生成视频及视频续写三类任务,能生成分钟级长视频。效率高,评测数据表现佳,安装和运行简便,引网友惊叹。
GLM-5正式发布,744B参数,对标Claude
GLM-5正式发布,对标Claude,参数从355B扩至744B,预训练数据增加。采用GlmMoeDsa架构,部署成本降低。数据表现佳,在多测试中成绩亮眼,还能直输Office文档,部署支持多框架和国产芯片,早期反馈积极。
Meta开源首个320亿参数代码世界模型CWM
Meta FAIR发布320亿参数的研究模型Code World Model (CWM),用“世界模拟”方式处理代码,试图真正“理解”代码逻辑。它在Math - 500数据集测试成绩亮眼,模型权重开放,可多渠道下载。
Transformer亲爹痛斥:当前AI陷死胡同,微调纯属浪费时间!
Sakana AI创始人Llion Jones是Transformer发明者之一,他警告当前Transformer虽成功,但业界或重蹈RNN覆辙,无数微调是浪费时间。他认为现在LLM非通用智能,已转向探索生物学启发的新架构。
小白也能秒懂:趣解GPU各种核心参数规格!
近期美国升级对英伟达H20芯片出口管制,业内震动。文章介绍GPU和显卡区别,讲解GPU关键参数如算力、核心数量等含义,还通过货车、火车类比助小白理解,助读者选合适GPU。
只用2700万参数,这个推理模型超越了DeepSeek和Claude
Sapient Intelligence研究者受大脑机制启发提出分层推理模型(HRM),该模型仅2700万参数、1000个训练样本,就在复杂推理任务上超越DeepSeek和Claude等模型,还引入近似梯度等创新设计。