「两阶段后训练方法」共找到 3667 篇相关文章
四足机器人首次同时「思考+走路」,北大提出链式推理MobileVLA-R1
在「大模型+机器人」浪潮中,让机器人既听懂话又走得对、稳很难。北大MobileVLA - R1将链式思考引入四足机器人,在仿真和真实实验中对标强基线实现提升,构建了更具工程可用性的范式。
从GPT-2到gpt-oss,深度详解OpenAI开放模型的进化之路
OpenAI 近日发布 gpt-oss-120b 和 gpt-oss-20b 两个开源模型,Sebastian Raschka 发布博客对其详细分析,回顾自 GPT - 2 以来 AI 社区进步,还与 Qwen 3 比较,介绍架构、训练、推理等细节。
深入剖析AI公司正在面临的:「囚徒困境」
文章指出AI模型训练成本虽下降,但运营成本尤其是推理费用飙升,使AI公司陷入两难。用户只青睐最强模型,且模型资源消耗远超预期,订阅模式难以为继,还给出了避免亏损的三条出路。
Token成本下降,订阅费却飞涨,AI公司怎么了?
文章指出,虽模型训练成本下降,但 AI 公司运营成本尤其是推理费用猛增。以固定费率订阅和高 token 消耗的商业模式的公司面临困境,如 Windsurf、Claude Code 等,还给出避免亏损的三条出路。
ICCV 2025 | 清华&腾讯混元X发现「视觉头」机制:仅5%注意力头负责多模态视觉理解
本文聚焦多模态大模型,提出基于 OCR 任务量化注意力头视觉偏好的方法,发现仅不到 5%“视觉头”主导视觉理解。还提出 SparseMM 策略优化 KV - Cache 资源分配,经多基准评测,性能和效率表现优。
RAG系统设计:揭秘语义搜索被低估的核心价值与KG驱动的架构选型策略
在AICon大会上,Hugging Face的尹一峰探讨基于语义搜索的RAG系统重要性,揭示其被低估原因,分析本质与作用,分享设计高效架构方法,还讨论KG驱动的RAG系统及范式选择。
AI开始玩乐高了?我拼一小时的乐高,它几秒就搭好,LegoGPT开源了!
卡内基梅隆大学提出LegoGPT,是首个依文本提示生成物理稳定乐高积木模型的方法。构建了StableText2Lego数据集,训练自回归大模型生成设计,还开发纹理生成法,设计能手动或机器人组装。
港中文联手美团开源“视觉推理通才”!图像视频10类任务一网打尽
香港中文大学MMLab与美团研究团队开源OneThinker模型,它可覆盖图像与视频十类核心视觉任务,在31项测试中表现出色,还展现泛化能力。研究团队搭建数据集,并引入EMA - GRPO算法提升训练稳定性。
OpenAI新幻觉论文惹争议!GPT-5拉胯是测试基准有问题??
OpenAI新论文《语言模型为何会产生幻觉?》提出,模型有幻觉是因标准训练和评估流程倾向奖励“猜对”。GPT - 5不爱猜测,在榜单表现不佳,网友质疑论文是为GPT - 5挽尊,论文引发网友多方向讨论。
视觉Token注入CLIP语义,走向多模态理解与生成新范式
腾讯ARC Lab等机构提出全新视觉分词器TokLIP,将低级视觉Token与高级CLIP语义结合,支持端到端自回归训练,可接入LLM框架,降低计算与数据门槛,在多模态任务中表现优异,代码已开源。