微调性能」共找到 2134 篇相关文章

推荐文章7

听说,大家都在梭后训练?最佳指南来了

大模型时代,Scaling Law 边际效益递减,业界转向后训练。《Post-training 101》博客可助初学者入门,涵盖从预训练到指令微调、SFT 原理、多种强化学习技术及模型评测方法等内容。

机器之心
开源动态7

DeepSeek突然拥抱国产GPU语言!TileLang对标CUDA替代Triton,华为昇腾Day0官宣支持适配

DeepSeek v3.2开源TileLang版本算子引关注,其可对标CUDA替代Triton,还适配国产算力生态,华为昇腾官宣支持。TileLang由北大团队主导,提供不同层次编程接口,助DeepSeek提升性能

量子位
开源动态8

数据减少超千倍,500 美金就可训练一流视频模型,港城、华为Pusa来了

香港城市大学与华为香港研究所合作推出 Pusa 项目,它基于 FVDM 理论,可极低成本微调大规模预训练视频模型,成本降超 200 倍、数据减少超 2500 倍,代码已开源。

机器之心
开源动态8

重磅!鸿蒙平台首个全跨端APP ——腾讯视频ovCompose框架发布

腾讯视频团队推出跨平台开发框架ovCompose,弥补Compose Multiplatform不足。还推出KuiklyBase,涵盖多项鸿蒙适配等建设。该框架有高性能、支持混排等优势,已开源,未来将持续优化。

腾讯技术工程
推荐文章8

翁荔最新万字长文:Why We Think

北大校友、前OpenAI华人VP翁荔发布万字长文《Why We Think》,围绕“测试时计算”和“思维链”,探讨提升模型性能的方法,涉及心理学类比、基于Token的思考、分支与编辑等多方面内容。

量子位
算法论文7

Claude 和 Manus 还要人工搭框架?小米直接让 Agent 自我进化

6月12日小米Darwin Agent Team发布论文《HarnessX》,用“系统自进化”终结Harness人工调优时代,带来性能跃升。其让Harness成为“一等公民”,有可组合等特质,还能与模型协同进化,虽有局限但成热门方向。

AI科技评论
推荐文章7

太空中的两重辐射威胁,一张薄膜就能全挡住

韩国科学技术研究院团队开发出新型复合材料,将两种纳米管组合,在单层超薄结构中实现对电磁波和中子辐射的屏蔽,为多领域提供轻量安全方案,但应用落地面临性能落差、成本等挑战。

DeepTech深科技
开源动态8

2.4K Star!小米最新开源!覆盖600+语种的语音克隆TTS,40倍实时合成速度!

小米k2 - fsa团队开源OmniVoice,这是支持600 + 语种的零样本语音克隆TTS模型,性能超ElevenLabs v2和MiniMax等标杆,RTF低至0.025,合成速度快40倍,还支持声音设计等功能。

开源星探
推荐文章8

给非技术人的大模型介绍:从零训练ChatGPT的全流程、天价成本及企业务实替代方案

文章介绍从零训练ChatGPT级别大模型的全流程、高昂成本,指出这对多数企业不现实。建议企业战略从构建转向应用,通过租用API或微调开源模型利用大模型,将专有数据视为核心资产。

AI Reading Hub
开源动态8

Hugging Face开源顶级模型:双模式推理+128K上下文,最强3B

今天凌晨,Hugging Face开源顶级小参数模型SmolLM3,参数30亿,性能超同类。它有128k上下文窗口,支持6种语言、双推理模式。架构细节等全开放,联合创始人强烈推荐,称是3B领域SOTA。

AIGC开放社区