「三段式后训练」共找到 3757 篇相关文章
拒绝“熵崩塌”和“熵爆炸”!这项研究让大模型学会“精确探索”,推理成绩飙升
2024年以来,大模型在推理任务上进展显著,得益于RLVR方法,但面临“熵困境”。研究团队提出选择性熵正则化方法(SIREN),通过三重机制精准调控探索行为,实验证明其能提升模型推理成绩。
我给滴滴AI提了个建议,结果他们做得超出了我的想象
作者因母亲用打车软件费劲,基于地图MCP构想长辈出行模式。滴滴AI看到后联系作者,三个月后拿出成果,不仅实现作者设想,还完善专车场景、做到全场景覆盖,体验很棒。
Ilya的首个模型来了!
掌握内幕的草莓哥爆料,Ilya正构建以TTT为核心的小型推理引擎。他预见传统大模型的死穴,SSI将TTT概念落地,其引擎在数据效率等方面优势明显。SSI获投资,本月或发新模型。
黄仁勋倡议的开源联名信,Anthropic 为何不愿签名?
黄仁勋分享支持开放权重模型的联名信,NVIDIA、Google等公司联署,Anthropic缺席遭网友讨伐。Anthropic研究人员回应引争议,这场讨论或存在错位,分歧关键在于发布前评测能否支持模型权重长期外授。
RAG搜对了却答错?德国萨尔大学找到了真相丨ACL'26
RAG是大模型落地标配技术,但存在搜到文档却答错的痛点。德国萨尔大学等团队提出Disco - RAG框架,在‘搜’和‘答’间加入‘读懂’环节,已被ACL 2026主会录用,在多基准测试表现优异。
Greg Brockman(OpenAI 联合创始人)把“那场宫斗”讲完整了:董事会、请愿书、马斯克与控制权
OpenAI联合创始人Greg Brockman做客播客,讲述公司“宫斗”内幕、与马斯克谈判细节等。还谈及模型能力、算力瓶颈、AI应用等,如GPT 5.1到5.2有质的飞跃,算力将成基本人权,AI推翻物理假设。
Python 2还能走多远?
自2020年Python 2停止维护,虽仍有项目在用,但企业和社区都在向Python 3迈进。文章介绍了Python 2的发展历程、存在的问题,阐述Python 3的优势,并给出了从Python 2切换到Python 3的方法。
Anthropic又「惹祸」?大写「HERMES.md」触发计费Bug,偷偷扣光用户200美元
Anthropic风波不断,Claude Code因用户Git提交记录中「HERMES.md」触发计费Bug,扣光200美元。用户反馈后,AI客服拒绝退款,网友吐槽不断,后工程师称是第三方检测工具Bug,将退款补偿。
模型「漂移」新范式,何恺明新作让生成模型无须迭代推理
训练生成模型复杂,传统扩散模型训练费时费力。何恺明团队提出「漂移模型」新范式,不依赖微分方程,支持一步推理,实验验证其在多领域性能佳,有望解决生成式AI质量与效率权衡问题。
用更一致的轨迹、更少的解码步数「驯服」掩码扩散语言模型,扩散语言模型的推理性能和效率大幅提升
扩散大语言模型发展迅猛,或成下一代大语言模型基础范式有力竞争者。复旦大学等团队发布论文,提出高效解码策略与强化学习训练组合,解决MDLM解码和训练问题,提升推理性能与效率。