「RAG性能优化」共找到 2978 篇相关文章
3D高斯泼溅,可输入视图量高达500!推理速度提升3倍,内存少80%
ZPressor能高效压缩3D高斯泼溅(3DGS)模型的多视图输入,解决其在处理密集视图时的性能瓶颈。它基于信息瓶颈原理,分三步压缩信息,降低内存占用和推理时间,提升3DGS在高视图输入下的性能。
全新稀疏注意力优化!腾讯最新超轻量视频生成模型HunyuanVideo 1.5核心技术解密
腾讯混元大模型团队发布并开源轻量级视频生成模型HunyuanVideo 1.5,参数8.3B,支持5 - 10秒高清视频生成。它通过多层次技术创新,在生成效果、性能与尺寸上实现平衡,还具备多种核心能力。
DiffMoE:动态Token选择助力扩散模型性能飞跃,快手&清华团队打造视觉生成新标杆!
清华大学和快手可灵团队推出DiffMoE,通过创新的动态token选择机制和全局token池设计,拓展了扩散模型的效率与性能边界。实验表明,DiffMoE在多方面超越现有模型,未来集成先进技术或有新增益。
通过查看GPU Assembly分析CUDA程序
文章是关于通过分析SASS代码提高内存受限CUDA程序性能的笔记。以向量复制程序为例,对比普通和向量化版本,通过查看SASS代码,解释向量化版本性能更快的原因是加载/存储数据量更大、启动块数更少。
AI搜索优化(GEO):从“被看见”到“被选中”的7个真相!【必看】
白杨SEO分享AI搜索优化(GEO)从“被看见”到“被选中”的7个真相,含为何做GEO、竞争内容、让AI理解和信任品牌的方法、成默认推荐答案的条件、效果评估及长期坚持的原因等。
不改模型也能提升推理性能?ICLR投稿提出测试时扩展新范式OTV
ICLR 2026投稿论文提出单token验证(OTV),是测试时扩展新机制,让模型能边推理边判断正误。它基于并行思考思路,借助轻量内部验证器分析推理过程,实验显示其性能优于主流方法。
高精度全身操控!从文本输入生成全身操控物体的动作
物体操控的整体动作生成是具广泛应用但极具挑战的任务,核心挑战在于手部与身体协调及关节式物体操控精度。香港大学提出协同扩散噪声优化框架CoDA,优化三个专用扩散模型,还采用BPS统一表示提高交互精度。
一边秀肌肉,一边设围墙,NVIDIA 发布 OmniVinci,性能碾压 Qwen2.5-Omni,却被骂“假开源”
NVIDIA 推出多模态大模型 OmniVinci,结合架构创新与合成数据流水线,训练 token 仅为 Qwen2.5 - Omni 的六分之一,却在多项基准测试表现更佳。但采用限制商业用途的许可证,引发“假开源”争议。
小扎「梦之队」首批论文上线!LLM自举进化,单步性能狂飙22%
Meta超级实验室MSL新论文探索用强化学习微调大语言模型。提出探索迭代(ExIt)法,基于RL自动课程学习,训练仅需单步任务,模型学会多步自我改进。在MLE - bench上,ExIt相对GRPO提升约22%。
【博客翻译】使用PyTorch加速生成式AI第四部分:Seamless M4T,快速优化
这是使用纯原生PyTorch加速生成式AI模型系列博客的第四部分,专注加速FAIR的Seamless M4T - v2模型。通过torch.compile + CUDA Graph,在不损失精度下实现text decoder模块2倍、vocoder模块30倍加速,端到端推理2.7倍加速。