小模型性能」共找到 8697 篇相关文章

推荐文章8

【万字长文】大模型训练推理和性能优化算法总结和实践

本文总结大模型落地的训练、推理和性能优化算法与实践,介绍语言模型发展,对比BERT、GPT等训练方式,分析生成式大模型问题,还阐述数据处理、推理优化及训练调优等内容,并给出不同场景技术选型建议。

阿里云开发者
算法论文8

EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!

近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。

深度学习自然语言处理
产品应用7

鹏汽车:没有基座模型,何谈物理AI|甲子光年

3月2日,鹏汽车宣布第二代VLA正式推送。何鹏认为,端到端模型无法让自动驾驶从L2跨越到L4,而第二代VLA开创全新物理模型范式,能直接学习真实物理世界,还在不断迭代提升。

甲子光年
推荐文章8

性能计算群星闪耀时

文章介绍高性能计算(HPC)对大模型的重要性,回顾中国HPC发展历程,讲述清华高性能所郑纬民等学者贡献,还提及团队在大模型训练、推理、存储等方面成果,以及类脑计算等新探索。

AI科技评论
算法论文8

突破类脑模型性能瓶颈:校正频率偏置实现性能与能效双突破|NeurIPS 2025

香港科技大学(广州)等团队在NeurIPS 2025论文指出,脉冲神经网络(SNN)性能不佳根源是频率偏置,非二进制激活。团队提出Max - Former架构,校正频率偏置,实现性能与能效双突破,卷积架构也适用。

量子位
产品应用8

从网页截图到精准复刻只需30秒:这个新模型刷新了我的认知

智谱AI发布GLM - 4.6V系列模型,是首个支持工具调用的视觉模型。作者对其进行7个场景测试,如识别鸟类、分析赶海地点等,展现出不错性能。该模型速度快、开源,有优势也有问题,适合开发者和普通用户。

花叔
推荐文章8

性能计算群星闪耀时

本文介绍了高性能计算(HPC)在大模型时代的重要性,以及清华高性能计算团队在HPC及相关领域的研究与实践。如郑纬民带领团队突破存储技术,陈文光、翟季冬等助力大模型训练,武永卫团队优化推理,张悠慧探索类脑计算。

芯师爷
开源动态8

国产LLM又迎来一波开源潮:Qwen、华为盘古、腾讯混元、米~

本周国产开源LLM集中爆发,Qwen、华为盘古、腾讯混元、米等接连发布模型。如Qwen3 - 4B性能提升,Qwen - Image文生图能力强;华为开源盘古模型并宣布CANN开源;腾讯混元尺寸模型特点多且已落地业务。

PaperAgent
开源动态8

阿里云通义点金发布DianJin-R1金融领域推理大模型,32B模型荣膺榜首

阿里云通义点金团队与苏州大学合作推出DianJin-R1金融领域推理大模型,介绍其开源数据集与模型、基于通义点金平台的数据合成,展示了其在性能测试中的优异表现,推动金融科技智能化进程。

机器之心
开源动态8

一个模型读懂所有医学数据,Hulu-Med探索医学大模型开源新范式 | 浙大x上交xUIUC

Hulu - Med是浙大、上交、UIUC等联合提出的通用医学视觉语言大模型,首次在单一模型统一理解医学多类数据。它开源透明,训练成本低,性能媲美GPT - 4.1,为医学AI带来新范式。

量子位