「自适应推理框架」共找到 3370 篇相关文章
AI Infra入门干货总结:大模型是如何高效推理的
作者深入研读vLLM源码,以Llama 3为例,聚焦Decoder-Only架构LLM,介绍推理各环节及张量维度变化,讲解连续批处理和Paged Attention概念,还阐述推理流程、采样策略等,最后总结相关拓展内容。
Meta「透视」AI思维链:CRV推理诊断,准确率达 92%!
Meta FAIR团队在论文中提出CRV方法,可实时观察AI思维过程。它通过改造模型大脑结构,让推理可见。在算术推理实验中,检测精度提升到92.47%,还能让模型修正错误。不过该技术落地尚面临诸多挑战。
大模型破译甲骨文创下新SOTA!复旦团队推出新框架
复旦大学团队提出基于部首和象形分析的可解释甲骨文破译框架,构建PD - OBS数据集。该框架在公开基准数据集上准确率高,零样本破译能力强,能输出可解释分析文本,助力考古破译。
VLA 推理新范式!一致性模型 CEED-VLA 实现四倍加速!
近年来,VLA模型成机器人领域重要研究方向,但推理速度受限。本文提出一致性蒸馏训练、混合标签监督机制及提前退出解码策略,在多基线模型上实现超4倍推理加速,实验验证其高效通用。
重磅!鸿蒙平台首个全跨端APP ——腾讯视频ovCompose框架发布
腾讯视频团队推出跨平台开发框架ovCompose,弥补Compose Multiplatform不足。还推出KuiklyBase,涵盖多项鸿蒙适配等建设。该框架有高性能、支持混排等优势,已开源,未来将持续优化。
Sora没做到的,LongVie框架给解决了,超长视频生成SOTA
视频生成近年进步大,但生成超1分钟高质量长视频仍难。上海人工智能实验室等机构提出LongVie框架,解决时序不一致和视觉退化问题,还推出评测基准LongVGenBench,该框架在多项指标达SOTA。
睡觉也在卷!伯克利Letta新作「睡眠时计算」让推理效率飙升
Letta和UC伯克利研究者提出「睡眠时计算」技术,能让LLM在空闲时间提前思考以提升推理效率,降低推理成本,在多数据集实验中展现优势,在软件工程任务中也有应用。
吴恩达新作:87%推理token用不着,丢掉反而快3倍
吴恩达新作Prefix Sliding指出,模型推理时丢弃中间已贬值token,只保留前缀+滑动窗口,无需训练可提速3倍,配合RL训练能将推理轨迹扩展到10万token以上。该方法为Agent场景提供新思路。
多模态卷王阶跃星辰Step 3登场,推理效率可达DeepSeek-R1 300%
新一代多模态推理基模Step 3登场,它采用原创MFA架构,具“多开好省”亮点,推理效率高、性价比优。7月31日将开源,能适配各芯片,还发起“模芯生态创新联盟”推动应用落地。
推理成本骤降75%!gpt-oss用新数据类型实现4倍推理速度,80GB显卡能跑1200亿参数大模型
OpenAI在gpt - oss开源模型采用MXFP4数据类型,使推理成本降75%,内存占用为BF16模型四分之一,生成token速度提4倍,还能降低硬件资源需求。不过MXFP4也有缺陷,英伟达推出NVFP4提升质量。