大模型微调」共找到 9254 篇相关文章

开源动态7

OmniAvatar震撼开源!阿里夸克开源全新音频驱动角色模型

音频驱动人体动画技术有局限,阿里夸克团队推出OmniAvatar模型。它用逐像素多层次音频嵌入和LoRA训练法,解决唇动同步等问题,适用于多领域,但也存在颜色偏移等不足。

带你学AI
新闻资讯8

Transformer亲爹痛斥:当前AI陷死胡同,微调纯属浪费时间!

Sakana AI创始人Llion Jones是Transformer发明者之一,他警告当前Transformer虽成功,但业界或重蹈RNN覆辙,无数微调是浪费时间。他认为现在LLM非通用智能,已转向探索生物学启发的新架构。

新智元
8

刚刚,DeepSeek扔出杀器,梁文锋署名!暴力优化AI架构

2026新年第一天,DeepSeek发表梁文锋署名新论文,提出「mHC(流形约束超连接)」架构。它仅增约6.7%训练时间开销,就能让27B参数模型性能显著提升,还可能淘汰ResNet结构。

力学与人工智能
算法论文8

突破!实验证明,RL能为LLM注入“创新”能力

此研究挑战‘RL不教新技能’观点,通过‘字符串转换预测’实验证明,RL能让LLM学会组合已有原子技能,形成可泛化、迁移的元技能,还给出模型能力提升路径。

深度学习自然语言处理
算法论文7

PolyVivid实现多主体视频定制,身份一致性超越现有模型

现有视频生成模型在多主体定制中难保持身份一致与自然交互,上交和腾讯提出PolyVivid框架解决此问题。它在多方面优于现有方法,还介绍技术原理、演示效果,证明其在多领域有实用价值。

带你学AI
开源动态8

效果非常不错!阿里昨开源图形海报生成模型Qwen-Image

阿里昨日开源多模态图像基础模型Qwen-Image,基于20B参数MMDiT架构,在复杂文本渲染和精确图像编辑方面有重突破,支持多风格图像生成、智能图像编辑等,还介绍了使用、部署等方法。

GitHubStore
开源动态8

谷歌开源Gemma 3 270M,性能超越Qwen 2.5同级模型

本周四,谷歌发布 Gemma 3 270M 模型,它参数小、功能强,具备指令跟踪等能力。在 IFEval 测试中表现出色,节能且适合多场景,谷歌还提供使用指南和试用途径,Gemma 系列下载量已破两亿。

机器之心
新闻资讯7

全球NAND老二,成了老三的第一股东

8月10日消息,截至8月3日,因贝恩资本旗下公司减持、东芝持续卖出股票,SK海力士通过可转换债券实质成铠侠第一股东。这一股权变动冲击NAND格局,影响产业整合,关键窗口期在2028年。

芯师爷
产品应用8

我宣布,这就是现在人声最真实的AI音乐模型

作者体验Minimax新推出的音乐模型Music 2.5,称其真实感强,中文无敌,咬字清晰,能唱维语等多语言。搭配粉丝开发的小工具,可尝试多种曲风,价格实惠,但功能有待完善。

数字生命卡兹克
新闻资讯7

刚刚,DeepSeek新模型MODEL1曝光,3处架构升级!

DeepSeek更新FlashMLA时曝光新模型MODEL1,从diff看它在MLA KV-Cache存储与访问方式上和V3/V3.2系列有3个本质差异,如物理排布更紧凑、引入‘extra’两段式cache、头维固定512×512。

PaperAgent