算法论文8
ParScale:大模型扩展新路线
通义千问Qwen
AI 摘要
研究团队:提出并行扩展ParScale路线,有新扩展定律,两阶段后训练策略降成本,在Qwen - 2.5上也能提升性能,适合边缘设备,后续会在更多模型和数据上尝试。
阅读原文 · 通义千问Qwen
ParScale:一种全新的大模型Scaling Law
文章提出并行扩展(ParScale)路线,在不增模型参数下,通过引入并行流提升性能。新扩展定律打破传统范式,两阶段后训练策略降成本,还适用于边缘设备,研究仍在进行。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
英伟达推理指南:华人团队方案成最优解
9月2日,英伟达技术博客上线《用投机解码做AI模型协同设计》,给出推理加速选型表。列入指南的核心方案多由华人团队主导,介绍了从外置草稿模型到n - gram查表法等方案,还提到硬件常数对模型架构的约束。
新智元
新闻资讯7
Meta发布Muse Spark 1.3,挑战谷歌模型
九月刚过3天就有五个前沿模型发布,Meta发布Muse Spark 1.3踢馆谷歌Gemini 3.8 Flash。它跑分提升大、成本低,性价比高,但也遭质疑,大模型下半场或比拼系统架构和智能体工程能力。
新智元
新闻资讯8
陈大年复出,小模型StartLux挑战大参数量模型
国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在信通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。
量子位
开源动态8
E - Commerce Bench揭秘大模型网店经营能力
为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异大,还发现单一指标会掩盖模型表现,评估基准潜力大。
千问大模型