「大模型预训练」共找到 9494 篇相关文章
他救了OpenAI、年赚过亿、三家明星CTO,却自曝跟不上AI发展了!硅谷大佬告诫:不是马斯克,就别碰大模型
Bret Taylor履历丰富,曾助力OpenAI解决危机。他认为AI市场将分化为前沿基础模型、AI工具层和应用型AI三个板块,不建议普通创业者做基础模型,看好应用型AI中Agent生态。还分享创业、编程等多方面见解。
「重要性采样」并不「重要」?快手清华ASPO攻克重要性采样权重错配
快手与清华合作团队发现大语言模型结果监督强化学习中,重要性采样机制“失灵”,存在权重错配现象。为此提出算法ASPO,在多基准测试中展现优势,训练更稳定。
腾讯AngelSlim升级,首个集LLM、VLM及语音多模态为一体的投机采样训练框架,推理速度飙升1.8倍
随着大模型应用成本与延迟问题凸显,腾讯混元升级 AngelSlim 训练框架,将投机采样技术拓展至全模态场景。它以 Eagle3 架构让推理速度最高飙升 1.9 倍,还具全模态训练、面向部署等亮点,有开源代码。
腾讯3D生成模型上新!线稿可变“艺术级”3D模型,鹅厂内部设计师也在用
腾讯上新艺术级3D生成模型Hunyuan3D - PolyGen,支持生成复杂几何模型,鹅厂游戏工作室用后美术师建模效率提升超70%。该模型在拓扑功能实测表现佳,还介绍了其核心原理和技术。
4倍速吊打Cursor新模型!英伟达数千GB200堆出的SWE-1.5,圆了Devin的梦!实测被曝性能“滑铁卢”?
Cognition推出全新AI编码模型SWE-1.5,专为软件工程任务设计,运行速度快,在基准测试中成绩良好。它基于GB200芯片训练,有定制编码环境,开发有新战略,还与Cursor新模型Composer对比引发关注。
从零开始200行python代码实现LLM
文章从传统思路出发,用Python实现极简大语言模型,介绍从零基础到Bigram模型的过程,包括词汇表、模型训练推理等内容,还讲解了PyTorch基础,最后实现pytorch版Bigram模型,后续将实现完整GPT。
劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束
谷歌发布世界模型原型产品 Project Genie,只需一句话或图就能一键生成可玩、可交互实时虚拟世界。它借助 Genie 3 等构建,解决了早期世界模型多短板,虽现处实验阶段,但已引发热议,应用潜力大。
发春节红包的大厂被约谈;百度O计划曝光,文心助手MAU增4倍;影石CEO回应年会送出5套房|AI周报
本周AI行业热点不断,大厂春节红包促销被约谈,百度文心助手MAU猛增4倍,影石年会豪送5套房。还有模型更新引吐槽、谷歌发债、迪士尼侵权指控等事件,也有新模型发布及企业应用新进展。
256G内存条涨到天价:不是内存条疯了,是算力正在变成新土地
近期,256GB内存条单根突破4万元。这并非普通DDR5,而是服务器专用内存。其价格飙升源于供需错配,大模型训练对大容量内存需求极端。有人认为是泡沫,也有人觉得是结构性变化。
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作
大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。