模型参数量」共找到 8093 篇相关文章

算法论文8

EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!

近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。

深度学习自然语言处理
新闻资讯7

忘掉大模型,微软实证:小模型才是Agentic AI的未来!

过去两年大模型在数学竞赛题上靠Test - Time Scaling发展遇天花板。微软rStar2 - Agent让14B小模型学会‘写代码→跑结果→改思路’,表现出色。还介绍了其基础设施、算法、训练配方等方法。

PaperAgent
产品应用8

你们催更的模型,云栖大会一口气全发了!

云栖大会上新6款模型、发布1个全新品牌,覆盖多场景。如Qwen MAX万亿参数模型能力登顶国际榜单,Qwen3 - Omni实现全模态不降智等,各模型能力升级显著,现已同步上线。

阿里云开发者
算法论文8

字节Seed新作:模型合并如何改变大模型预训练范式

字节跳动Seed团队在arXiv发表论文,提出预训练模型平均(PMA)技术。该技术将模型合并引入预训练阶段,可提升性能、预测衰减阶段表现,还能解决训练问题。不过,高学习率影响和强化学习应用待研究。

机器之心
算法论文7

微软等提出「模型链」新范式,与Transformer性能相当,扩展性灵活性更好

随着大语言模型发展,扩展 Transformer 架构成趋势,但参数规模增长带来训练负担。微软等研究者提出 CoR 概念,构建模型链学习范式,应用于语言模型得 CoLM 系列,实验显示其性能相当且扩展性、灵活性更好。

机器之心
新闻资讯7

“通用大模型微调成为行业模型是伪命题”?医疗AI深度重构,传神语联创始人何恩培:孪生智能体能砍70%线下复诊工作

本文为《2025 年度盘点与趋势洞察》系列访谈,传神语联创始人何恩培分享医疗 AI 发展看法。他认为通用大模型微调成行业模型是伪命题,介绍了传神素问中医大模型应用,还对比中西医 AI 化差异,探讨未来发展场景与挑战。

InfoQ
开源动态8

Day0迁移、一键部署,华为开源的昇思MindSpore成为大模型开发的“万能钥匙”

在大模型无法一统天下的背景下,开发者面临在一个框架、生态体验众多主流大模型和AI技术的难题。华为开源的昇思MindSpore可实现训练Day0迁移、推理一键部署,还介绍了其相关技术和实测效果。

量子位
开源动态8

他们让万亿参数RL学会了「省着跑」,顺便砍掉九成算力

2025年,强化学习成大模型进化主战场,但万亿参数模型跑RL成本高。Mind Lab团队实现1T参数模型LoRA高效RL训练,GPU消耗降90%,技术开源。此外还有Memory Diffusion记忆机制等成果。

量子位
新闻资讯8

杨植麟当主持人的大模型圆桌:张鹏罗福莉夏立雪都放开说了

中关村论坛上,杨植麟、罗福莉、张鹏、夏立雪、黄超齐聚,共论agent的下一代演进。各位大咖观点硬核,如罗福莉认为中国大模型团队优势在‘算力受限下的最优解能力’,张鹏解释智谱新模型涨价原因等。

量子位
开源动态8

HF日趋榜一!真端到端模型AutoDeco终结手动调参解码

大语言模型手动调参解码繁琐,腾讯AI Lab王琰团队联合港中大(深圳)唐晓莹教授团队推出AutoDeco架构,通过创新训练策略让模型动态预测解码参数,在多模型实验中表现出色且已开源。

机器之心