「后训练技术」共找到 5938 篇相关文章
蚂蚁·安诊儿医疗大模型:正式开源并登顶权威医疗榜单
近日,蚂蚁集团联合浙江省卫生健康委开源自研的蚂蚁·安诊儿医疗大模型。它基于蚂蚁百灵大模型架构,经深度训练,是参数规模最大的开源医疗模型。该模型在多评测中表现出色,有三阶段训练流程,架构高效、推理快,已开源助力行业发展。
a16z:AI 产品初期用户流失高很正常,M3 留存才是评估 PMF 的关键
a16z研究团队分析数百家AI企业后发现,将衡量用户留存率基准点从M0后移至M3,能更清晰评估PMF和GTM策略。AI产品留存曲线分获客、留存、扩张三阶段,M12/M3比率是预测长期留存关键指标。
你的扫描全能王,作价217亿冲刺港股IPO
扫描全能王母公司合合信息拟作价217亿赴港IPO,冲刺“A+H”双重上市。其C端有扫描全能王等产品,B端有TextIn等产品。合合以文本智能技术为核心,打造三大技术平台,C端靠付费订阅、B端卖产品模块盈利。
让推荐学会思考:用强化学习激活大模型的序列推理能力
文章指出推荐系统曾未紧密结合大模型能力,如今正靠近其训练范式。作者基于用户行为序列,用强化学习训练大模型理解序列关系,以预测用户下一个可能点击的资讯,并通过实验验证了该方法的可行性,还探讨了不同数据库中BM25算法的差异。
SGLang Hierarchical Sparse Attention 技术深度解析
阿里云等团队推出面向 Sparse Attention 的分层稀疏化框架,介绍其架构、机制与实践。此框架破解了长上下文推理时的计算与容量瓶颈,以 DeepSeek DSA 集成测试,使推理性能大幅提升,目前项目处于开发阶段。
SGLang 确定性推理实现技术细节笔记
文章围绕SGLang确定性推理展开,介绍其启用方式,详述批次不变性原理与Batch Invariant Ops实现,如Matmul Persistent Kernel设计;还阐述确定性采样、Attention Backend配置、AllReduce改动等,给出环境变量及测试脚本,有完整解决方案。
砺算科技GPU背后的故事
文章讲述砺算科技GPU背后故事,包括其团队核心成员来源,经历的资金、欠薪等问题,还提及S3人员流动衍生出的其他GPU企业。分析砺算科技团队稀缺性、融资短板等情况,对比不同GPU发展路线。
一篇持续强化学习技术最新综述
文章对持续强化学习(CRL)进行全面考察,关注其核心概念、挑战和方法,提出新的分类体系,从知识存储和/或转移角度将CRL方法分为四类,并分别介绍各类方法特点。
16个月后Meta杀回开源,小扎力挺蒸馏
Meta发布新开放AI模型Muse Glimmer底层参数,未来几周将开放Muse Spark 1.2模型权重。扎克伯格力挺开源,称要为数十亿人提供免费强大AI,还为模型蒸馏辩护。Meta此举有现实压力,也想创造算力需求。
第 3 章 Agent 核心功能技术详解
本章以Claude Code及其生态为主参照,介绍现代Agent平台提供类似‘操作系统’机制,包括命令、记忆等。面向熟悉Python与LLM的开发者,按是什么、解决什么问题等展开,还分析了Agent工程核心挑战。