「性能对比」共找到 2310 篇相关文章
【博客转载】CUDA Shared Memory Swizzling
文章讨论用swizzling技术处理CUDA共享内存bank冲突,它可重排索引映射避免冲突且不浪费内存。以矩阵转置为例,对比有冲突、填充、swizzling三种实现,还分析了swizzling和填充优缺点。
砍掉70%内存!陈丹琦团队破解LLM长文本瓶颈
大型语言模型处理长文本时,KV缓存占用内存巨大。陈丹琦团队提出KV足迹作评估标尺,推出分块驱逐与PruLong训练技术,在128K长文本任务中最高降低70%内存,性能损失仅10%。
揭秘千卡 GPU 集群如何高效训练多模态大模型:vivo AI 团队实战经验分享|AICon
在 InfoQ 举办的 AICon 大会上,vivo AI 架构师王兆雄分享多模态大模型训练经验。介绍了 LLaVA 和 DiT 模型训练挑战,从数据处理、模型计算等方面提出优化策略,还展望 AI Infra 未来发展方向。
SGLang 推理引擎的技术要点与部署实践|AICon 北京站前瞻
SGLang 是开源推理引擎,截至 2025 年 6 月,在 GitHub 获近 15K Stars,月均下载超 10 万次,被多家行业巨头采纳。InfoQ 专访其核心开发者尹良升,他分享技术、挑战等,6 月 27 - 28 日他将在 AICon 演讲。
让AI自己设计芯片!中国科学院发布「启蒙」,芯片全流程自动设计
近日,中科院计算所联合软件所推出「启蒙」系统,基于AI实现处理器芯片软硬件全流程自动设计,达到或部分超越人类专家水平。该系统在多方面表现出色,如设计的CPU达ARM Cortex A53性能等。
开源黑科技!向量数据库,居然要被 MP4 给干掉了!
GitHub开源项目Memvid,能用MP4视频文件替代昂贵的向量数据库,检索达亚秒级。它把文本编码成视频,用配套JSON索引记录位置,结合sentence-transformers和FAISS实现语义搜索,存储和检索性能出色。
首次解释LLM如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升
西北大学与Google、谷歌DeepMind团队质疑传统强化学习与反思的关系,提出贝叶斯自适应强化学习方法,首次解释为何、如何及何时反思探索新策略,还给出决策数学形式,实验显示其性能更优。
南开 && UIUC | SearchAgent-X,打破「效率瓶颈」,让复杂「AI搜索智能体」走向现实
南开大学和伊利诺伊大学厄巴纳 - 香槟分校的研究提出SearchAgent - X框架,解决大型语言模型驱动的搜索智能体效率痛点。它剖析制约效率的原因,通过两大‘加速引擎’优化性能,实验显示效果显著。
Dify、n8n、Coze、Fastgpt、Ragflow到底该怎么选?超详细指南~
文章对比了Dify、Coze、n8n、FastGPT和RAGFlow五个主流平台,从功能、使用体验、应用场景等方面详细分析其特点,给出选择建议,还提醒考虑预算、技术能力等要素,帮读者选合适平台。
实测 Google I/O 放出来的 Imagen4,不如GPT4o、甚至不如Imagen3。。
作者实测 Google I/O 推出的 Imagen4,发现它在生成封面图时审美和文字表达不佳。对比 Elo 评分及实际出图,在指令遵循、细节还原等方面,Imagen4 不如 GPT4o 甚至 Imagen3。