「三段式后训练」共找到 3743 篇相关文章
结构化扩展拿下Agent工具检索新SOTA,精准找到API|ICLR'26
宁波东方理工大学沈晓宇团队在ICLR 2026发表论文,指出当前工具检索瓶颈在于工具文档。提出对文档结构化扩展,再训练模型的方案,构建TOOL - REX等组件,实验显示显著提升检索性能。
告别Reasoning模型的“灵光一现”,推理能力可控了
当前GPT - 4o、DeepSeek - R1等大模型推理的‘高级操作’随机触发,不可控。研究者受经典推理三要素启发,教会模型三种‘元能力’,经三阶段训练,模型效果提升,让推理能力可控。
刚刚,北京建了一座AI工厂:目标10万P算力,日产10万亿Token!
九章云极在2026全球智算科技峰会发布AI工厂战略,含训练和Token工厂,目标10万P算力、日产10万亿Token。用DCU度量投入,Token度量产出,重构智能生产与交付体系,适配不同企业需求。
从零开始200行python代码实现LLM
文章从传统思路实现诗词生成器入手,介绍了词汇表、Bigram模型等概念,接着用Python和PyTorch实现了真正的Bigram模型,阐述模型、训练等内容,最后回顾成果,下一篇将基于此实现完整GPT。
Anthropic万名工程师都离不开!深夜随手撸出的开源神器,被OpenAl高价收购,23人创业逆袭
昨日,OpenAI 宣布收购 AI 安全初创公司 Promptfoo,其技术将整合进 OpenAI Frontier 平台。该公司由 23 人创立,开发开源工具测试 AI 系统安全。收购后 Promptfoo 保持开源,OpenAI 将新增相关功能。
人生文件系统
文章探讨用AI管理人生,提出把人生建模为统一文件系统。还指出多数人建目录树后文件夹易空,分享设计原则,如采用最小可行结构、写入阻力最小化、视项目为一等公民等。
DeepSeek-OCR生态爆发!从前端到跨平台,解锁OCR新玩法!
近年来OCR技术应用广泛,DeepSeek-OCR开源后引发开发者关注。文章盘点其四个衍生项目,有轻量级前端应用、Windows桌面应用、全Rust跨平台客户端和专业PDF转换工具,覆盖多场景。
苹果AI选Mamba:Agent任务比Transformer更好
苹果新研究指出,在长任务、多交互的Agent式任务中,基于SSM架构的Mamba在效率与泛化能力上超Transformer。虽Mamba有局限性,但引入外部工具后性能显著提升。
谷歌nano banana正式上线:单图成本不到3毛钱,比OpenAI便宜95%
昨晚谷歌图像生成与编辑模型nano banana上线,正式名gemini - 2.5 - flash - image - preview。它有强大能力,成本低,有多种玩法,上线后测试火爆,在多个榜单成绩优异。
重大技术突破!微软发布BioEmu模型,蛋白质模拟从数年压缩至几小时
今天凌晨,微软CEO分享蛋白质模拟模型BioEmu,可将蛋白质动态模拟从数年缩至几小时,已在《自然》发表。它能解决传统方法难题,核心设计独特,训练整合多数据源、采用多阶段策略。