「混合精度训练」共找到 2462 篇相关文章
大模型训练新突破!Meta提出LSP:无数据也能实现能力飞升
Meta提出语言自我博弈(LSP)方法,利用自我博弈框架让模型自我改进,不依赖额外数据。LSP赋予模型挑战者和解题者身份,引入GRPO和KL散度正则化技术,解决了大模型训练的数据依赖难题。
腾讯开源智能体新框架:不用训练无需充值,用开源模型实现SOTA Agent
智能体框架是推动智能体生态发展的基础设施,但现有框架存在上手门槛高、依赖闭源模型等问题。腾讯优图实验室开源Youtu - agent框架,无需训练模型、不依赖闭源API,性能领先,有多个核心亮点和典型应用案例。
EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法
vivo AI Lab 算法团队提出新的大模型后训练框架 GTA,综合 SFT 和 RL 优点,解决文本分类场景中 RL 收敛慢问题。论文已被 EMNLP 2025 录用,介绍了 GTA 框架设计思路、实验结果等,未来还将探索更多场景和大模型。
GPT-5≈o3.1!OpenAI首次详解思考机制:RL+预训练才是AGI正道
OpenAI研究副总裁Jerry Tworek在播客访谈中称,GPT-5类似o3.1。他详解模型推理过程,强调RL+预训练是AGI正道,肯定DeepSeek的GRPO算法,还分享自身经历及OpenAI工作结构。
Generalist之后,罗剑岚团队推出LWD,也要变革具身智能训练范式
智元机器人与上海创智学院联合发布全新具身智能训练范式 LWD,可让机器人在真实世界部署中持续自主改进。它打破传统 AI 静态模式,构建数据飞轮,在四大维度创新,经测试表现出色,或成具身智能转折点。
在一台1970年代的PDP-11上训练Transformer需要多久?答案是5.5分钟
近日,开发者复现1970年代技术环境,用PDP - 11汇编语言实现Transformer并训练成功,项目叫ATTN - 11。在低资源下实现功能闭环引热议,大家思考Transformer到底需要什么。
RF-DETR-首个突破60 AP的实时检测器(附实战教程)
RF-DETR在COCO数据集上,实时检测精度首破60 mAP,兼顾实时性与高精度。它通过NAS找到Transformer实时运行的‘最优解’,迭代快,适用于多场景,还给出完整实战教程。
明略科技吴明辉:企业级Agent的“精度陷阱”与人机协同重构之路
2025 年 12 月 19 日,明略科技创始人吴明辉在 AICon 大会分享《可信 Agent 的规模化之路》。他指出企业级 Agent 存在“精度陷阱”,建议重新设计人机分工,让 AI 执行 Task,人定义目标、校验结果、审计逻辑。
开发者狂喜:Thinking Machines发布首款产品Tinker,后训练麻烦全给包了
OpenAI前CTO创办的Thinking Machines推出首款产品Tinker,这是用于微调语言模型的API,能简化LLM后训练过程,支持前沿模型,使用LoRA技术降低成本,还发布开源库,多高校团队已试用。
单次训练横扫9个基准,遥感检测最大数据集与基础模型框架问世
北京航空航天大学团队发布面向通用遥感目标检测的大规模数据集与基础模型框架 LEVIRDet,构建了 LEVIRDet - 159 数据集,提出 LEVIRDetNet 模型。前者为训练泛化能力强的模型提供新数据基础,后者在多基准测试中表现出色。