「有监督微调」共找到 6447 篇相关文章
政策“开闸”之后:我们该如何看待这波半导体IPO热潮?|甲子光年
近期国产半导体项目IPO速度加快,政策为产业打通资本血脉。本文以屹唐、摩尔、沐曦为例剖析热潮内核,指出企业有技术依赖、财务亏损等问题,IPO后还面临估值高、技术泡沫、地缘政治风险。
支付宝出手了,全民级的AI健康管家来了。
作者参加蚂蚁AI医疗产品发布会,介绍了全新AI产品AQ。它是专门的AI健康助手,免费用,能精准定位病因,还可预约挂号,与医保打通,有健康档案等功能,打破医疗信息差,未来可期。
GitHub上已突破5.1k stars!这是真正被开发者认可的 AI Agent平台,AI开发者必看,如何用它实现生产力逆袭?
TaskingAI是AI - native应用开发平台,整合多模块提供一站式BaaS体验,简化AI应用全流程。它支持多模型,有检索、工具插件等功能,适用于客服、销售等场景,还对比同类项目展现优势。
国产模型编程能力卷到这个程度了?MiniMax-M2.5 深度实测
文章深度实测MiniMax-M2.5编程能力,用其开发多款游戏和点名工具,结果出色。还分析其底层技术,如原生Agent RL框架、过程奖励机制等,指出它性价比高,虽有不足但值得关注。
医疗AI质变时刻来临!国产医疗AI率先突破,临床诊疗能力问鼎全球
文章指出当前医疗AI真实能力与临床期待有落差,为此中国医生联合制定全球首个评估医疗AI临床适用性标准,完成对主流模型测评,中国企业打造的MedGPT夺冠,还推出‘未来医生’平台服务患者。
美团提出多模态推理新范式:RL+SFT非传统顺序组合突破传统训练瓶颈
美团研究者提出Metis - RISE框架,将RL激励和SFT增强以非传统顺序结合提升多模态大语言模型推理能力。先RL激发潜能,再SFT补齐短板,训练的两模型在OpenCompass榜单成绩优异。
奖励模型也能Scaling!上海AI Lab突破强化学习短板,提出策略判别学习新范式
上海人工智能实验室提出策略判别学习(POLAR)新范式,解决奖励模型设计与训练瓶颈。POLAR可灵活适配多样需求,弥补传统奖励模型短板,契合强化微调框架,实验证明其性能和泛化性优越。
Jina Embeddings v4 的量化感知训练
文章聚焦Jina Embeddings v4的量化感知训练。介绍量化技术可压缩向量体积、提升检索效率,对比四种主流量化方法,重点实验PTQ和Output QAT,还测试非对称量化,给出实验结果与结论。
DeepSeek-R2尚未问世,微软小模型捡漏称王?6000样本炼出「数学作弊器」!
微软推出Phi-4推理模型系列,参数最多14B,能在本地高性能笔记本电脑上流畅运行。Phi-4-mini-reasoning在数学推理上性能超越DeepSeek-R1蒸馏模型,且参数规模更小。文章还介绍了模型特点、训练方法、性能表现及局限性等。
88天登录193次!顶级证据+循证医学,让500万中国医生拥有「神助攻」
国内医生面临高负荷工作与医学知识快速更新的挑战,通用大模型在医学场景中存在高幻觉率问题。阿里健康推出医学AI产品「氢离子」,具备低幻觉、高循证特点,有四层循证架构,还与多方合作构建数据壁垒。