「低数据场景」共找到 4835 篇相关文章
误入人均10个顶级offer的技术天团活动,顶尖AI人才的选择逻辑我悟了
作者参加京东TGT计划活动,与两位入职京东的顶尖AI人才交流。Daniel因京东重视生成式推荐项目、技术氛围纯粹而选择它;Kyrie则被创业热情、技术理想共鸣及数据优势吸引。入职后两人都获核心项目机会。
MoE RL 实战:统一 FP8 全流程训练
SGLang RL 团队等实现 RL 全流程 FP8 训练与采样,消除训推不一致性。介绍 FP8 硬件基础、格式等,分析训练难点,定位 KL Loss 异常源于量化原理,验证其在 MoE 模型 RL 场景优势,指出模型规模与训推不一致的关联。
sgl-kernel MoE Align Block Size Kernel 优化过程解析
文章记录SGLang的sgl-kernel中优化 `moe_align_kernel.cu` 的过程。MoE模型的 `moe_align_block_size` kernel从最初的baseline版本经多次迭代,包括加向量化padding、用Blelloch Scan并行化前缀和、用Warp Scan减少同步开销等。
为什么说多模态是推荐系统破局的关键?来自饿了么一线的实战复盘
文章围绕多模态推荐展开,从传统推荐算法演进到多模态表征技术,结合饿了么场景实践,还探索生成式推荐。介绍多模态推荐挑战与代表性工作,梳理表征技术发展,详述饿了么系统设计与训练,分析生成式推荐方案及业界路线。
英伟达挑战者,估值490亿
AI芯片初创公司Groq完成7.5亿美元融资,估值达69亿美元。它由前谷歌工程师创立,致力于打破英伟达垄断,产品能低成本维持AI性能,但在生态、大规模模型支持等方面与英伟达有差距,短期内难威胁其地位。
6.1B打平40B Dense模型,蚂蚁开源最新MoE模型Ling-flash-2.0
蚂蚁百灵大模型团队开源 MoE 大模型 Ling-flash-2.0,其以轻量级配置展现卓越性能,在推理速度、任务性能、部署成本间找到新平衡,为大模型‘参数膨胀’提供新路径,还在多领域应用表现出色。
吴恩达最新来信:是时候关注并行智能体了
吴恩达在最新来信中指出,并行智能体正成为提升AI能力新方向,多个agent协作能高效处理不同任务。相比依靠数据和算力提升性能的方法,并行agent提升性能同时无需用户久等,且大模型token成本下降使其可行。
OpenAI重大发现:GPT-4b micro改造诺奖研究,山中因子重编程效率提高50倍
OpenAI与Retro Bio合作,用新模型GPT - 4b micro设计出新型山中因子变体,使重编程效率提高50倍。此前山中因子重编程效率极低,限制其应用,此次改进是突破。研究还在多方面验证了变体效果。
刚刚,小红书开源了首个多模态大模型dots.vlm1,性能直追SOTA!
小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。
最强开源Agent!Kimi K2接入Claude Code,爽翻~【喂饭级教程+实测】
上周五Kimi开源最新旗舰模型K2,它是1000B参数MoE大模型,专为Agent场景优化,API已上线且兼容多API。文章给出Kimi - K2接入Claude Code的喂饭级教程及实测,实测显示组合表现有亮点也有不足。