「MoE热启动技术」共找到 3098 篇相关文章
DeepSeek发布最新论文,5大杀手锏让大模型训练、推理暴涨
全球著名开源大模型平台DeepSeek在huggingface发布超强开源模型V3的论文,从硬件架构和模型设计双视角探讨高效训练和推理,提出DeepSeek - MoE、多头潜在注意力等创新技术,解决内存、计算效率等难题。
4.4w颗星!又一个CC Switch,几乎支持所有模型
Free CC(FCC)是本地 API 代理 + 协议转换层,能让客户端透明使用任意 OpenAI 兼容或专用上游模型,保留客户端能力。支持多提供商,架构分层、设计清晰,还有多种技术特性,文中给出安装、启动等步骤。
硬核拆解大模型,从 DeepSeek-V3 到 Kimi K2 ,一文看懂 LLM 主流架构
本文详细列举 8 个主流大语言模型,硬核拆解架构设计与革新思路,介绍架构演进趋势。如 DeepSeek-V3 的 MLA 与 MoE 技术,OLMo 2 的归一化策略,Gemma 3 的滑动窗口注意力机制等。
Manus被收购,智谱也定了8天后上市
12月30日智谱启动港股招股,1月8日将挂牌上市,拟发售3741.95万股H股,每股116.20港元,预计募资43亿港元。其基石投资者认购近七成,技术以GLM为核心,模型表现出色,但上市后面临诸多挑战。
飞猪搭建系统演进:从人工运营到多Agent协同搭投生产
飞猪移动端页面搭建体系从初代寄生于阿里集团平台,发展成“搭投”体系。但传统人工选搭投模式待优化,为此启动AI智能搭投升级专项,构建新范式,还介绍产品结构、技术实现及后续规划。
用AI重新审视人类发明史:我们的技术本该比现在更先进吗?
美国研究员 Brian Potter 用 AI 分析 1800 年到 1970 年代 190 项重大发明,判断最早何时能造。结果显示多数发明没迟到太久,1900 年后发明间隔缩短,75%约束是技术性的。
追忆左耳朵耗子
本文追忆技术人左耳朵耗子,讲述其创业故事,包括创业契机、方向选择等,还分享技术见解,如选技术语言、积累技术等,探讨成长问题,如996、大小公司权衡等,最后推荐书籍并谈对年龄危机看法。
MCP技术浪潮中的Agent应用开发新范式
当下,MCP迅速发展重塑AI开发协作生态。太极平台借MCP汇聚多方能力,释放大模型潜能。文章介绍MCP技术、执行细节,探讨其与Agent、Function Calling关系,分析技术生态,还思考了MCP发展变化与局限。
网站GEO技术端优化指南:案例+工具+免费检查清单【转推】
文章指出当前处于传统搜索到AI搜索转型期,Google仍是主流。介绍Google和ChatGPT流程差异,给出抓取、索引、曝光优化建议,还列了该做与不该做之事,并有免费检查清单。
Claude Code完整技术栈都被扒出来了,Multi-Agent架构~
analysis_claude_code项目对Claude Code v1.0.33逆向工程分析,含混淆代码技术分析等。发现实时Steering机制、多Agent架构等,为AI agent系统设计实现提供技术参考,还介绍系统架构创新点。