推理性能优化」共找到 4225 篇相关文章

新闻资讯8

7个月翻一番!AI agent能力飙升,METR报告揭示指数级进化规律

非营利研究机构METR报告显示,Agent能力每7个月翻一番,这在9项基准测试中得到验证,任务涉及编程、数学等领域,大模型正迈向高度自动化,且Agent性能提升快,未来处理复杂任务能力或更强。

量子位
产品应用8

腾讯混元A13B用130亿参数达到千亿级效果,Flash Attention作者点赞

腾讯混元A13B模型仅130亿激活参数,却能和千亿级大模型竞争,获Flash Attention作者赞叹。它精准卡位性能与效率‘甜蜜点’,依托高质量预训练和结构化后训练,多方面表现突出且已全面开源。

量子位
推荐文章7

【博客转载】CUDA Constant Memory

文章介绍 CUDA 常量内存,它是设备上 64KB 被缓存的只读特殊内存空间。通过示例比较不同访问模式下常量内存和全局内存性能,指出块或 warp 一次访问时,常量内存快 10%;线程一次或伪随机访问时,慢很多。

GiantPandaLLM
产品应用7

搜索 ≠ 简单匹配!0代码实现语义级图文互搜

在非结构化数据爆发增长的当下,传统图文检索方式难以满足企业需求。本方案介绍借助阿里云 Milvus 实现高效多模态图文检索,覆盖多场景,有开箱即用、性能强等优势,还给出架构、部署、验证及清理资源的方法。

阿里云开发者
算法论文8

扩散语言模型真的会比自回归好?理论分析结果可能恰恰相反

北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与自回归模型在不同评估指标下的效率,指出选择模型要视任务需求。

机器之心
算法论文8

字节Seed新作:模型合并如何改变大模型预训练范式

字节跳动Seed团队在arXiv发表论文,提出预训练模型平均(PMA)技术。该技术将模型合并引入预训练阶段,可提升性能、预测衰减阶段表现,还能解决训练问题。不过,高学习率影响和强化学习应用待研究。

机器之心
算法论文8

Qwen&清华团队颠覆常识:大模型强化学习仅用20%关键token,比用全部token训练还好

Qwen与清华LeapLab团队研究发现,大模型强化学习训练推理能力时,仅20%高熵token就能撑起效果,甚至超全部token训练。团队用此在Qwen3-32B创造新SOTA记录,还探讨了强化学习的相关特性。

量子位
算法论文8

成本暴降88%!通义实验室、北大发布ZeroSearch,无需搜索即可激活LLM检索能力

信息检索能力对提升大语言模型推理表现至关重要,但现有方法在训练中面临文档质量不可控和搜索 API 成本高昂两大挑战。为此,通义实验室和北大提出 ZeroSearch 框架,无需真实搜索即可激活 LLM 检索能力,显著降低成本。

机器之心
产品应用8

3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!

文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在多个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。

CourseAI
产品应用7

Fable 5.1变身Token刺客,几分钟烧光额度!AI圈掀起「榨汁革命」

Anthropic发布的Fable 5.1虽性能强但极耗Token,引发开发者不满。当前AI产业面临算力饥渴与Token通胀问题,企业落地AI痛点多。迅策科技的TokenCloud平台能助力企业高效转化Token,还介绍了其配套产品TokenOS。

新智元