「端到端训练」共找到 4131 篇相关文章
阿里+清华发现80/20法则:LLM只靠20%的token就能学会Reasoning
阿里与清华研究发现,训练大语言模型(LLM)推理时,真正关键的是20%的高熵token,其余80%低熵token几乎无用。仅用20%高熵token做强化学习,效果超全量训练,还提出RLVR训练策略提升效率。
2026,最惨一年?Optimus全员拼到死,清华校友跳槽到特斯拉
苹果核心华人AI科学家Yilun Chen转投特斯拉Optimus团队。马斯克透露AI芯片进展,特斯拉AI软件副总裁预警2026年是艰难一年。同时,部分特斯拉核心工程师出走至初创公司,硅谷投资人看好家用消费级机器人。
Token纪元:从「马力」到「人天」再到「兆字元时」的认知革命
文章指出,AI时代需全新生产力计量单位“马斯”。字元是AI“语言燃料”,但缺乏统一计量体系。智能社会的容量、速度、价格是关键指标,当前AI算力网络停在2G时代,AI劳动力崛起将重构就业,Token或引发文明跃迁。
Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制
论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。
从需求到设计到代码,一个软件全搞定!TRAE Work Design实测来了
TRAE Work上新Design模式,与Work、Code模式配合,实现需求、设计、代码全链路在一个平台跑通。它能识别提取设计系统,提供多种改图方式,且出图合规、改图顺手,还简化了工作流。
LangChain 彻底重写:从开源副业到独角兽,一次“核心迁移”干到 12.5 亿估值
本周,LangChain 宣布完成 1.25 亿美元融资,投后估值 12.5 亿美元,还发布了里程碑式更新 LangChain 1.0,这是一次从零开始的重写。LangChain 最初是副业,发展成热门开源项目,此次重写解决了此前问题,有诸多升级。
LangChain 彻底重写:从开源副业到独角兽,一次“核心迁移”干到 12.5 亿估值
本周,LangChain 宣布完成 1.25 亿美元融资,投后估值 12.5 亿美元,还发布里程碑式更新,LangChain 1.0 正式登场,这是一次从零开始的重写。它最初是副业,后成热门开源项目,此次重写解决了过往问题。
2025小结:从RL到Agentic RL
作者回顾2025年从RL到Agentic RL的发展,指出Agentic RL存在慢、不稳定、难scale的问题,还探讨了RL与推理、CoT的关系,以及RL的泛化能力,认为RL能提升模型能力但还不稳定,期待明年研究。
从 yield 到 await:Python 协程的进化史
文章按时间线与逻辑脉络,讲述 Python 协程从生成器到`async/await`的进化史,介绍各阶段特点、困境及解决方案,如`@wrappertask`的应用,还提及演进带来的启示。
深度之赌:从卧室到上帝机器
文章讲述现代AI秘史,从Jeff Dean本科研究神经网络失误,到Google Brain诞生;还有Hinton等深度学习先驱经历,如Hinton当实习生、AlexNet诞生等,也提及Google发展及未先发ChatGPT原因。