LLM微调库」共找到 1420 篇相关文章

算法论文8

突破后训练瓶颈?Meta超级智能实验室又一力作:CaT解决RL监督难题

AI后训练依赖监督微调或程序化检查器,但很多有价值任务缺这两种资源。Meta超级智能实验室等机构研究者提出CaT方法,把推理时额外计算当教师信号,为大模型提供监督,实验显示效果显著。

机器之心
新闻资讯7

2025年了,AI还看不懂时钟!90%人都能答对,顶尖AI全军覆没

AI基准ClockBench测试AI读模拟时钟能力,人类平均准确率89.1%,11个主流大模型最好仅13.3%。研究展示了LLM局限性,分析了可能原因,还对比了不同模型表现及在各类问题上的差异。

新智元
算法论文8

为什么大模型会产生幻觉?OpenAI最新研究终于搞清楚了

OpenAI发布研究论文剖析LLM幻觉根源,指出当前主流训练与评估体系是核心驱动因素之一。现行评估奖励猜测行为,幻觉起源于预训练的‘下一词预测’,论文还澄清五大误区,建议改革评估体系。

AI寒武纪
8

企业落地 NL2SQL,需要的是 AI-ready data 和 小模型

当NL2SQL从Demo走向生产,关键是‘更干净的数据底座 + 更小的专用模型 + 更可控的工程化流程’。文章指出先数据后模型,小模型足够用且落地成本低,评估要换维度,还介绍了工程化路径等内容。

InfoQ
推荐文章7

构建可靠AI Agent:从提示词、工作流到知识的实战指南

本文阐述如何构建可靠、高效且可落地的AI Agent应用。随着LLM和工具调用标准化,开发核心竞争力转向提示词工程、工作流设计和知识构建。还介绍各部分要点及安全策略,给出确定AI项目的方法。

阿里云开发者
开源动态7

以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能

dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。

PaperAgent
新闻资讯7

别焦虑!不会用AI也不会被淘汰,工程师老哥实测各类工具:10倍生产力神话太夸张了

工程师科尔顿·沃奇实测Claude Code等AI开发工具后发现诸多问题,如难以理解大型代码上下文、跟不上标准等。他认为‘10倍生产力’是神话,AI需工程师引导,大家不必因AI而焦虑。

量子位
推荐文章8

极致优化Android平台APK的大小

文章以Android为例,介绍UE包可裁剪部分的优化思路与实践,优化APK大小和Native运行时内存占用。从压缩NativeLibs、代码体积优化、资源裁剪等方面着手,还给出优化效果和额外资料。

腾讯技术工程
算法论文8

英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了

英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了熵崩溃和训练不稳定问题。

新智元
开源动态7

GitHub CLI 增强了对三角工作流的支持

2025年4月,GitHub宣布更新其CLI,增强对三角工作流的支持。此工作流涉及原始、个人分支和本地环境,更新前gh pr命令有管理难题,改进后获开发者好评,还对比了GitLab和Bitbucket相关支持情况。

InfoQ