产品应用7
Agent助力Diffusion模型多方面优化
GiantPandaLLM
AI 摘要
BBuf:记录用Agent优化Diffusion模型过程,指出不能只盯着GEMM等,Micro Benchmark快不代表模型快,数值问题要提前确定。介绍SGLang Diffusion Kernel结构、优化实践、验证流程等。
阅读原文 · GiantPandaLLM
基于Agent的SGLang Diffusion Kernel优化实践:Qwen-Image、FLUX.2和视频模型
本文记录基于Agent完成Qwen-Image、FLUX.2、Wan和SANA Video优化的过程,包括定位问题、写Kernel及遇到的坑。介绍SGLang Diffusion Kernel结构,分析数值敏感原因,展示各模型优化实践、无收益实验及验证流程。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
谷歌推出Gemini 3.8,姚顺宇称RSI飞跃
深夜谷歌推出Gemini 3.8,六周内第三款Flash系列模型。含通用的Gemini 3.8 Flash和网络安全专用的Gemini 3.8 Flash Cyber,提升推理、代码能力,在多场景表现出色。已面向不同群体开放。
机器之心
新闻资讯7
Google 6 周 3 次升级,发布 Gemini 3.8 Flash
Google DeepMind 官宣发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两个新模型。3.8 Flash 在软件工程等方面有显著提升,跑分成绩亮眼,价格实惠,性价比高;3.8 Flash Cyber 面向网络安全场景。目前 3.8 Flash 已在多平台上线。
AGI Hunt
算法论文8
吴恩达:丢弃推理token可提速3倍
吴恩达新作Prefix Sliding指出,模型推理时丢弃中间已贬值token,只保留前缀+滑动窗口,无需训练可提速3倍,配合RL训练能将推理轨迹扩展到10万token以上。该方法为Agent场景提供新思路。
PaperAgent
7
Violoop:押注个人主权AI设备
Violoop获亿元级融资,产品计划9月16日众筹。它想让AI设备随使用更懂用户,提出“个人主权AI”,即个人掌握经验与改进能力。研发聚焦让AI理解人,设置主权边界,有三层自进化路径,还探索多终端应用。
甲子光年