LLM微调库」共找到 1417 篇相关文章

产品应用7

好奇心之旅:Cursor代码索引机制的学习笔记

作者作为高德信息工程团队AI先锋队一员,日常用Cursor开发,因好奇其代码索引机制展开探索。介绍了Cursor索引工作流程、隐私安全等,还研究Merkle树、turbopuffer向量及开源方案Continue。

阿里云开发者
算法论文7

刚刚,OpenAI前CTO:战胜LLM不确定性的方法找到了!

OpenAI前CTO创立的Thinking Machines Lab发布研究《战胜LLM推理中的不确定性》。研究指出LLM推理不确定性主因是批处理大小变化,而非常见认为的GPU并行性等。还给出实现批处理不变性的方案及实验结果。

PaperAgent
算法论文8

用LoRA微调VLM做乳腺癌病理分类,实战对比CNN

哈萨克斯坦团队论文对比CNN和用LoRA微调的VLM在乳腺癌病理分类上的表现。指出VLM微调后接近CNN水平,但CNN仍是王者。还介绍LoRA原理、实验设计、结果,给出实战代码及对从业者和研究者的启示。

机器学习AI算法工程
推荐文章8

构建 AI 时代的知识底座:直播数据 LLM Wiki 实践

文章围绕直播数据 LLM Wiki 实践展开,指出领域知识沉淀面临挑战,引出 LLM Wiki。介绍其实际效果,如指标召回、代码生成等,阐述构建方法、架构设计、编译流水线、检索方式,还提及增量编译与持续 Lint,最后给出未来规划。

阿里云开发者
算法论文8

RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈

大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。

深度学习自然语言处理
算法论文8

LightMem用3招重新设计了LLM的记忆,结果出乎意料

LLM在超长多轮对话中有上下文窗口有限、记忆系统昂贵的痛点。LightMem借鉴人类记忆机制,用三招重新设计LLM记忆,实验显示其准确率超基线,还降低token使用量、API调用和运行时间。

PaperAgent
算法论文8

无需验证器的RL:RLPR解锁LLM通用推理潜能

现有依赖强化学习与可验证奖励(RLVR)提升大语言模型(LLM)推理能力的方法,受限于领域特定验证器。本文提出RLPR框架,利用LLM生成正确答案的固有概率作奖励信号,实现无需外部验证器的通用领域强化学习,效果显著。

深度学习自然语言处理
推荐文章8

大模型微调评测入门:看懂这些指标,才知道模型好不好

文章指出大模型微调中很多新手重“调”轻“评”,评测是决定模型落地的关键。介绍分类和生成任务评测指标,给出实操步骤,还说明如何综合判断模型好坏,最后展望评测技术朝自动化等方向发展。

机器学习AI算法工程
算法论文7

5大维度、4类模态:LLM/Agent数据分析技术全景图

文章分享《LLM/Agent-as-Data-Analyst: A Survey》,上交大、清华、微软等将「LLM/Agent 当数据分析师」技术拆成 5 大设计维度与 4 类数据模态,给出 100+ 代表性方法等,还介绍不同数据类型的分析技术。

PaperAgent
新闻资讯7

LLM 语境下,「持续学习」是否是 「记忆」 问题的最优解?

本期通讯解读 3 个 AI 业内要事,包括谷歌嵌套学习范式引争议、AI 产品记忆方向探讨、英伟达合成数据等。谷歌 NL 范式想规避遗忘问题,测试中 HOPE 表现优,但也遭质疑,当前 LLM 研究更关注改善记忆。

机器之心