全量微调」共找到 2574 篇相关文章

算法论文8

单卡即可微调大模型!内存占用仅1/8,性能依然拉满 | ICML 2025

基础大模型应用于下游任务时微调成本高,低秩适应(LoRA)方法虽降低成本,但性能不及全量微调。华中科技大学和香港中文大学团队提出GOAT框架,在25个多领域任务验证效果好,内存占用仅1/8。

量子位
产品应用8

杀疯了!单卡4090跑通全量微调,面壁1B级多模态性能怪兽硬刚大厂

面壁智能推出MiniCPM-V 4.6,参数约1B,性能和推理效率出色。它在多模态任务综合能力、推理速度上领先竞品,靠ViT架构改造和4倍/16倍混合视觉Token压缩实现创新,有工业验证,对开发者和普通用户意义大。

AI寒武纪
推荐文章7

大模型微调知识与实践分享

文章详细介绍大型语言模型(LLM)微调知识与实践,包括模型结构、参数等知识,以及Prompt工程、数据构造、LoRA微调等技术点。还给出微调实践流程,介绍相关平台和框架,如星云、TuningFactory等。

阿里云开发者
产品应用7

从提需求到部署发布,AI自动化后,研发效能面跃升

文章介绍腾讯在研发中推进AI自动化,将自动化向上下游环节延伸,分L1、L2、L3阶段演进。阐述了面临的挑战及应对举措,分享人机协同和自动化交付实践,展示效果数据,展望未来双轮驱动体系。

腾讯技术工程
算法论文8

开源模型竟被用于窃取下游微调数据?清华团队揭秘开源微调范式新型隐藏安风险

清华、墨尔本大学团队研究指出,基于开源模型微调专有模型存在新型隐藏安风险,开源模型发布者可埋后门窃取下游微调数据,新风险难检测、危害大,目前攻防方法待改进。

机器之心
开源动态8

MiniCPM-o 4.5 技术报告发布:双工模态 API 开放,RTX5070 即可实时运行

面壁智能等发布 MiniCPM-o 4.5 技术报告,开放双工模态 API。该模型 9B 参数,RTX5070 可实时运行,下载超 25 万。报告披露 Omni - Flow 框架,模型性能强,还能催生新应用。

AI前线
开源动态8

MiniCPM-o 4.5 技术报告发布:双工模态 API 开放,RTX5070即可实时运行

面壁智能联合多机构发布 MiniCPM-o 4.5 技术报告,公开 Omni-Flow 框架。该模型 9B 参数实现端到端双工模态,开放在线 Demo、API 等,最低 12GB 显存 GPU 可运行,在多维度评测表现出色。

AI科技评论
开源动态8

断网可用!首款双工模态大模型技术报告发布,附一键安装包

面壁智能等联合发布MiniCPM-o 4.5技术报告,它是业界首个端到端双工模态大模型,采用Omni - Flow架构。同步推出在线Demo、API、端侧安装包等,低显存GPU即可运行,性能表现优秀,应用潜力大。

新智元
新闻资讯7

Claude骂声中启动「隐形水印」:新模型嵌入,标记所有文字

Anthropic宣布新款Claude将在生成文本中嵌入隐形水印,还会给特定文件附加数字签名元数据,球统一施行。此前A社就用Unicode贴暗标,虽称不影响生成质,但遭质疑。

量子位
开源动态8

网开测GPT-oss!技术架构也扒明白了

网开测GPT-oss,它登顶开源模型王座,性能比肩o3-mini、o4-mini,适合本地推理。网友探索出多种用法,还推出Pro版。其架构也被扒出,官方介绍了微调方法,吴恩达等大佬也参与测评。

量子位