「系统分析」共找到 2649 篇相关文章
MOE RL实战:统一FP8全流程训练
SGLang RL团队等联合完成工作,实现RL中全流程FP8训练与采样。介绍FP8训练硬件基础、格式、scale选择等,指出训练难点,分析KL Loss异常归因,验证其在MoE模型RL应用效果,还探究模型规模对训推不一致性的影响。
苹果不吹 AI,反而成功了?
北京时间9月10日苹果发布会,新款iPhone等产品更新。此次发布会多数环节AI几乎消失,与iPhone 16发布时大肆宣传不同。苹果因在智能体AI助手进展落后,重点放硬件及AI幕后支持。不过苹果仍承受分析师压力,且在AI竞赛中落后。
冲上热搜!美团大模型,靠「快」火了
国内外开发者亲测,美团新开源的LongCat - Flash - Chat模型速度超快,推理速度超每秒100个token。它来自美团LongCat - Flash系列,官网可直接用。该模型架构创新,训练方法高效,还做了专属和系统级优化,跑起来又快又便宜。
DeepSeek一句话让国产芯片集体暴涨!背后的UE8M0 FP8到底是个啥
DeepSeek V3.1发布后,官方留言提及新架构和下一代国产芯片,引发AI圈轰动,国产芯片企业股价上涨。文章介绍了UE8M0 FP8概念,分析其适配国产芯片原因,还猜测适配的芯片厂商,指出代表国产AI走向软硬协同。
大模型如何"不训练"也能学习?——上下文学习的隐式权重更新机制
大型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层低秩权重更新,解释了ICL原理,为构建AI系统开辟新路径。
开源项目捐给基金会后又往回要,维护 7 年出钱出力却被告上法庭?网友:捐了代码想收回去靠它赚钱,太无耻!
云原生计算基金会 (CNCF) 与开源消息系统 NATS 背后的 Synadia 公司就 NATS 项目的商标、域名和 GitHub 存储库控制权产生纠纷。Synadia 曾将项目捐赠给 CNCF,如今想“撤回”并变更许可证,双方各执一词,最终达成 Synadia 同意 CNCF 控制相关资产的协议。
别再卷数据了,LLM也怕「过劳死」!CMU等揭秘灾难性过度训练
CMU、斯坦福等四大名校研究团队挑战“预训练规模越大越好”观点,提出“灾难性过度训练”现象,即增加预训练数据可能导致后训练性能下降,并从现实证据、控制实验、理论分析等方面阐述新研究贡献,还介绍了相关实验及结论。
14k颗星!你的电脑屏幕,正在成为AGI的“眼睛”!这款开源神器让你一键记录所有操作
介绍开源项目ScreenPipe,它是跨平台桌面数据抓取API,能全维度记录数据,有沙盒化插件系统等功能。因能为AGI提供数据、对开发者友好而火,还给出安装和创建插件命令,称其有成为AGI时代“现实采集器”的野心。
支付宝“阿宝”背后的 Agentic 终端:从对话到办事,xUI 如何重构 AI 交互
本文整理自蚂蚁集团支付宝AI端云交互负责人魏凤笛的大会分享,系统介绍支付宝AI入口产品“阿宝”背后的xUI技术体系,涵盖通信、交互、执行、多Agent协同四大核心方向,分享了大厂移动端Agent落地的工程实践与未来规划。
5秒出4张2K大图!阿里提出2步生成方案,拉爆AI生图进度条
阿里智能引擎团队针对Qwen最新开源模型,将SOTA压缩水平从80 - 100步前向计算骤降至2步,速度提升40倍,5秒可出4张2K高清大图。已发布Checkpoint,集成到呜哩AI平台。文章还分析传统蒸馏方案问题并介绍团队改进策略。