「MoE热启动技术」共找到 3098 篇相关文章
PyPI遭投毒!LiteLLM用户Python启动就中招,个人凭证秒泄露
PyPI被投毒,LiteLLM的1.82.7和1.82.8版本被植入信息窃取程序,安装后SSH密钥等数据会泄漏。该漏洞源于Trivy被篡改,攻击者借此发布恶意版本。已给出自检流程,供应链攻击或常态化。
ICLR 2026北京论文分享会启动,直击「AI龙虾」、世界模型新范式
2026 年人工智能领域,「龙虾」(OpenClaw)私人 Agent 助理成人机交互标杆,世界模型受关注。ICLR 2026 4 月将在巴西举行,机器之心 4 月 18 日在北京举办论文分享会,邀大家参与交流。
Dense、MoE之外第三条Scaling路径:交大提出JTok模块,省1/3算力
上海交通大学与小红书Hi Lab联合团队提出JTok/JTok - M模块,作为插件挂载在Transformer层,几乎不增算力和显存开销却显著提升性能。该模块构建新scaling路径,在多任务测试中全面提分,为大模型发展提供新方向。
GPT-5.2技术炸场!6大核心突破,办公效率拉满
OpenAI凌晨发布GPT-5.2,把专业级AI门槛拉到新高度。它有6大核心技术突破,精准戳中职场痛点。在GDPval基准测试中表现出色,有三级模型矩阵,不同版本满足不同需求,各方面能力均有显著提升。
字节前技术负责人创业,联手清华姚班校友,编程智能体世界登顶
词元无限团队开发的编码智能体 InfCode,在权威 AI Coding 基准中登顶。它定义 AI 编程「工程时代」,有代码意图分析等亮点,背后是豪华团队,致力于构建商业闭环。
NVIDIA技术沙龙《强化学习流水线优化:性能分析与 Rollout加速》演讲笔记
该演讲笔记围绕强化学习流水线优化,强调用Nsight Systems做性能分析,介绍在Ray Actor添加参数及解读文件方法。给出训练/生成参数优化技巧,如Actor训练和Rollout优化,还以Qwen 2.5 7B等模型为例总结参数调优经验。
AutoGLM 2.0 深度解析:云端智能体的技术跃进与现实挑战
2025 年 GUI Agent 赛道升温,多数产品依赖本地执行。智谱 AI 在 8 月 AutoGLM 2.0 闭门交流会上展示新路径,其由国产模型驱动,具多能力,在 Agent 云端执行架构、训练方式等方面有突破,也面临一些挑战。
重大技术突破!微软发布BioEmu模型,蛋白质模拟从数年压缩至几小时
今天凌晨,微软CEO分享蛋白质模拟模型BioEmu,可将蛋白质动态模拟从数年缩至几小时,已在《自然》发表。它能解决传统方法难题,核心设计独特,训练整合多数据源、采用多阶段策略。
国产 AI 昇腾推理不再高门槛?开源技术栈推理性能对比解析
文章聚焦昇腾 NPU 大模型推理,对比 MindIE 和 vLLM Ascend 推理性能。因 MindIE 使用门槛高,昇腾联合 vLLM 社区推出插件。实验用 GPUStack 平台,结果显示二者在不同场景各有优势,呼吁构建国产 AI 基础设施体系。
ICML 2025|趣丸研发新型人脸动画技术,声音+指令精准控制表情
广州趣丸科技团队提出新颖肖像驱动框架Playmate,能根据音频和控制条件生成高质量肖像视频,精准控制表情和姿态。成果被ICML 2025收录,代码开源筹备中,在多方面优于现有方法。