产品应用8
腾讯混元A13B:小参数大能量,获专家点赞
量子位
AI 摘要
腾讯混元A13B用130亿激活参数达千亿级效果,获专家赞叹。它采用细粒度MoE架构,经高质量预训练与结构化后训练,在多评测中表现优异,已全面开源并用于腾讯超400业务场景。
阅读原文 · 量子位
腾讯混元A13B用130亿参数达到千亿级效果,Flash Attention作者点赞
腾讯混元A13B模型仅130亿激活参数,却能和千亿级大模型竞争,获Flash Attention作者赞叹。它精准卡位性能与效率‘甜蜜点’,依托高质量预训练和结构化后训练,多方面表现突出且已全面开源。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Anthropic营收反超OpenAI,IPO占优
IPO前夕,Anthropic最新年化营收达650亿美元,8个月翻超7倍,反超OpenAI。双方在资本市场竞争激烈,A社在起跑时间、财务、商业模式上占优,但OpenAI用户规模和产品生态占优,目前A社牌面更好。
量子位
新闻资讯8
菲尔兹奖得主:AI数学优势在‘输得起’
OpenAI发布内部版模型Astra的十项成果,引发数学界震动。菲尔兹奖得主Timothy Gowers分析其成果,指出AI优势在‘输得起’,还探讨找例方法、模型短板,给出训练建议与衡量跨越门槛的标准。
新智元
算法论文8
北大等提出 TensorCast,推理首字延迟最高降 93.2%
随着模型规模增长、新应用兴起,大模型基础设施面临管理「张量状态」挑战。北大、阶跃星辰与北邮联合提出 TensorCast,解耦张量状态,复用管理能力,在多场景测试中表现出色,为大模型基建提供新范式。
机器之心
产品应用8
智谱GLM-5.3:编程与网安能力大跃升
智谱发布GLM-5.3,743B参数模型,编程能力达开源SOTA。网络安全能力涌现,基准得分是GLM-5.2两倍多。全部提升来自后训练缩放,还自研Z.ai Code Bench评估,安全评估加固后权重将开源。
AIGC开放社区