开源动态8
阿里开源长文本思考模型
量子位
AI 摘要
阿里:开源长文本深度思考模型QwenLong - L1。通过渐进式上下文扩展训练,解决长文本训练难题,在多测试中表现优,还指出SFT提效经济,RL达最优性能必要。
阅读原文 · 量子位
阿里开源长文本深度思考模型!渐进式强化学习破解长文本训练难题,登HuggingFace热榜
阿里开源长文本深度思考模型QwenLong - L1,登上HuggingFace热门论文第二。它解决了长文本强化学习训练难题,通过渐进式上下文扩展训练,在多基准测试中表现出色,还探讨了SFT和RL作用。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
TACL 综述:长文本模型能力取决于数据
该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。
深度学习自然语言处理
新闻资讯7
Codex负责人:Codex两三月后将过时
Codex负责人称两三个月后Codex将过时,因下一代模型要处理大规模并发Agent,非其能应对。Huggingface实验显示大小模型在不同harness下排名差异大,脱离模型谈harness过时或不适配说模型Agent能力都不妥。
探索AGI
产品应用8
阿里发布Qwen3.8,编程16天造出智能体
8月3日,阿里发布新一代基座大模型Qwen3.8,总参数量2.4万亿,编程和办公能力提升,在权威榜单中表现出色。其API已上线,价格有优势。‘千问办公’公测,Qwen3.8性能强大,还适配阿里真武M890超节点。
InfoQ
产品应用8
阿里Qwen3.8-Max发布,性能强价格优
阿里巴巴突袭发布新一代基座大模型Qwen3.8 - Max,它总参数量达2.4万亿,在多场景表现出色,在权威榜单冲进全球第一梯队,性能直逼Claude,且价格实惠,实测反馈良好。
量子位