「低成本训练」共找到 3843 篇相关文章
大模型虽好,但恕我直言:在OCR面前,开源小模型更香
作者所在公司项目需处理大量纸质文档,起初考虑云端大模型API调用和开源大模型本地化部署,却因成本高、硬件要求高受阻。后经推荐调研PaddleOCR,其功能全、成本低、易用性强,最终被选为项目核心方案。
百度Qianfan-VL开源,纯国产自研昆仑芯跑出世界一流
百度开源全新视觉理解模型Qianfan-VL,有3B、8B和70B三个版本,在昆仑芯P800芯片上训练。该模型多模态能力强,OCR和教育场景表现突出,跑分超国际主流模型。芯片功耗低、架构优,模型训练方法创新。
奖励模型终于迎来预训练新时代!上海AI Lab、复旦POLAR,开启Scaling新范式
在大语言模型后训练阶段,奖励模型设计与训练是关键瓶颈。上海AI Lab、复旦推出预训练奖励模型POLAR,采用策略判别学习新范式,适配强化微调,性能和泛化能力强,为LLM后训练带来新可能。
医疗幻觉率比DeepSeek低3倍,百川循证增强大模型横扫全球医学考试!
百川智能发布首个循证增强医疗大模型Baichuan - M2 Plus,将循证医学理念融入训练和推理,首创六源循证范式。其在多场景评测中幻觉率低,多国医考成绩优异,已上线百小应APP并开放API。
GPT-5.6 Sol首批内测结果来了!同任务成本只有Fable 5一半
GPT-5.6 Sol预览版发布半月,首批内测报告出炉。它代码简洁,适合长链路任务,视觉效果好。虽整体略逊Fable 5,但成本近乎减半,且安全限制小,即将全量上线。
MiniMax M2.5:230B参数仅激活10B,开源模型首次逼近Claude Sonnet,成本仅十分之一
MiniMax推出新一代开源模型M2.5,官方称其为‘为现实世界生产力设计的开源前沿模型’。性能逼近Claude Opus 4.6,采用混合专家架构,成本低。已在内部大规模部署,定位为‘AI员工’。
仅需一行代码AI智商飙升成本反降!Claude推出军师模式:最强模型opus只做幕后大脑
Anthropic在Claude平台实装军师策略,让Opus模型后台当军师,轻量级模型当执行者。仅改一行代码就能实现,成本低且能提升智商,已开启Beta测试,还给出使用步骤。
陶哲轩对谈 OpenAI 高管:“试错成本”无限趋零,AI 正在把数学变成一门重工业
菲尔兹奖得主陶哲轩与OpenAI顶尖科学家Mark Chen对谈,探讨AI在数学研究中的能力、缺陷与演化路径。指出AI试错成本低,在数学领域发展潜力大,虽目前有局限,但正改变数学研究方式。
地瓜机器人携手虚时科技,补上具身智能的仿真数据“黑洞”|甲子光年
5月12日,虚时科技与地瓜机器人联合开发的AnySceneGen平台发布,这是面向具身智能训练的仿真空间生成平台。具身智能训练需海量数据,传统仿真数据生产依赖人工,效率低。该平台以模型替代人工,重构生产方式,优势显著。
构建会“说话”和“行动”的 AI:生成式数字人技术与 EchoMimic 实践
在 QCon 全球软件开发大会上,支付宝李宇明围绕 EchoMimic 介绍生成式数字人进展、技术、应用及研究思路。对比传统数字人,生成式数字人成本低、易控制,但也有技术新、推理成本高的问题。EchoMimic 两版本已开源,经优化推理速度可提升。