「全量微调」共找到 2584 篇相关文章
sglang 源码学习笔记(二)- backend & forward 过程
本文深入解析sglang forward核心实现全流程,介绍了forward传递过程、AttentionBackend数据结构,以flashinfer为例展开分析,还说明了cudaGraphRunner初始化、Capture、Replay过程,助读者理解代码。
19.2K Star!Linux上无缝运行Win应用,超酷~
在Linux系统下运行Windows应用一直是难题,开源项目WinBoat能让Linux用户无缝运行Windows应用,通过容器和远程桌面技术,将Windows应用变Linux原生窗口,还具备自动化部署等多样功能。
Kimi K2基于DeepSeek V3构建
从Hugging Face模型配置文件可知,月之暗面未设计全新模型结构,而是选Deepseek V3作基座模型,用自身高质量数据、独特方法做大量‘微调’和‘后训练’。
Google大神开源Agent Skills:专治AI偷懒
AI编程工具常偷懒致上线问题多,Google大神Addy Osmani开源Agent Skills,含19个覆盖全流程的技能、7条快捷指令和反借口机制,可通过一条命令使用,支持多种工具。
MiniCPM 4.0来了!220倍极速狂飙,端侧模型的比赛,结束了
面壁智能联合清华发布MiniCPM 4.0,极限场景220倍加速。它是首个原生稀疏模型,有三级火箭推理加速体系,性能强,适配全平台,应用广泛,或成端侧AI分水岭。
Karpathy 教它的 nanochat 数单词里有几个“r”
Andrej Karpathy 教超小型语言模型 nanochat d32 数单词里字母 r 的数量,创建 SpellingBee 合成任务微调模型,虽像填鸭式教学但有效,不过小模型上下文处理能力有限。
Qwen2.5VL新玩法,看电影讲故事
本公众号关注AI前沿技术,分享实战案例与课程。介绍视觉叙事技术及挑战,基于Qwen2.5 - VL 7B模型微调Qwen Storyteller,构建StoryReasoning数据集,还给出实战代码及相关链接。
最新原生端到端OCR开源项目!
腾讯开源最新原生端到端OCR:HunyuanOCR,仅1B参数,OmniDocBench得分94.1超竞品,功能覆盖全场景。还介绍了DeepSeek - OCR的桌面客户端,支持拖拽识别、导出文件等。
Qwen2.5VL又多一个娱乐场景,看电影讲故事
文章聚焦Qwen2.5VL新娱乐场景“看图讲故事”。介绍视觉叙事目标、挑战,讲述基于StoryReasoning数据集微调Qwen Storyteller模型的解决思路,含核心技术,还给出实战代码及相关链接。
Vercel 开源 Open Agents,支持后台运行 AI 编码工作流
Vercel 开源 Open Agents,支持创建和运行后台编码智能体,提供全栈解决方案。它采用三层架构,核心是智能体与沙箱解耦,支持多步执行等功能,定位为参考实现,引发不同反响。