「精细化Token管理」共找到 1205 篇相关文章
1个决定痛失千万美元!90后前英伟达工程师不后悔:老黄这3句更值钱
2022年深秋,Sid Pardeshi在ChatGPT爆发前夜辞去英伟达高级工程师职位,错过数千万美元股票收益。他不后悔,在英伟达七年多从黄仁勋处学到比财富更值钱的东西,还总结出黄仁勋管理哲学的三个启示。
从宁波到登陆港交所,“边缘AI芯片第一股”的突围之路
2月10日,爱芯元智登陆港交所,被誉为“中国边缘AI芯片第一股”。它以“混合精度NPU”与“AI - ISP”为核心技术,构建产品矩阵。营收增长强劲,客户基础拓宽,应用领域广泛,在行业中排名靠前,但也面临挑战。
Mini-sglang-01:从Client到Scheduler的消息流转之旅
文章围绕轻量化大模型推理系统mini - sglang,详细介绍消息从客户端经APIServer、Tokenizer到Scheduler的流转过程,分析核心组件功能、消息体系、正反向链路及优化策略,还预告后续分析调度和模型实现逻辑。
OpenAI 发布新的 Codex 桌面版,我现在不骂 Codex 难用了
OpenAI发布Codex Desktop App,是macOS桌面应用。它有图形界面,支持定时任务、Skills管理和多Agent并行运行。还对比了与Claude Code的差别,介绍了OpenClaw项目,最后说明不同用户的使用场景和用量定价。
大模型的第一性原理:(二)信号处理篇
本文从信号处理角度解读大模型原论文,探讨语义向量化原理,分析 Transformer 与 Granger 因果关系。指出大模型输入 Token 语义嵌入是将自然语言处理转化为信号处理问题,向量化与信号处理、信息论联系紧密。
算力稀缺时代,如何把 GPU 用“满”
在 GPU 稀缺且利用率低的背景下,本文分析其‘用不好’的原因,探讨业界共享技术方案的局限。以腾讯云 TencentOS qGPU 为例,解析内核态虚拟化及在离线混部技术,还介绍其在多行业降本增效的实践。
“75亿元投资理财”?摩尔线程回应
近期,摩尔线程拟将IPO募集的不超75亿元闲置资金用于现金管理引关注。公司称募投项目分阶段投入,此举为提高资金使用效率,不影响项目推进。12月20 - 21日将举办开发者大会。
具身机器人征服1万伏高压线!-10℃严寒、13米高空全天候作业零事故
亿嘉和新一代配网带电具身智能机器人能在1万伏高压线上独立完成复杂精细操作,已在多省份部署,完成万余次任务。它“有脑子”,效率接近人工90%且零事故,未来还将迭代升级。
AI太空竞赛?英伟达H100刚上天,谷歌Project Suncatcher也要将TPU送上天
11月2日英伟达将H100 GPU送入太空,谷歌宣布开展Project Suncatcher,2027年初发射原型卫星将TPU送上天。该项目利用太阳能卫星群,可扩展AI计算规模,谷歌还分享早期研究成果,不过仍面临工程挑战。
LightMem用3招重新设计了LLM的记忆,结果出乎意料
LLM在超长多轮对话中有上下文窗口有限、记忆系统昂贵的痛点。LightMem借鉴人类记忆机制,用三招重新设计LLM记忆,实验显示其准确率超基线,还降低token使用量、API调用和运行时间。