开源动态8
Qwen3技术报告首次全公开
通义千问Qwen
AI 摘要
通义千问:Qwen3技术报告全公开。它整合思考与非思考模式,引入预算机制,降低轻量级模型资源。在多测试领先,多语言支持扩至119种。后续将扩大预训练、改进架构及增加强化学习投入。
阅读原文 · 通义千问Qwen
Qwen3技术报告首次全公开!“混合推理模型”是这样炼成的
本文首次公开Qwen3技术报告,介绍其模型架构、预训练及后训练过程、性能表现等技术细节。Qwen3整合两种模式,引入思考预算机制,降低轻量级模型计算资源,在多基准测试领先,多语言支持扩展至119种,所有模型开源。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
智谱GLM-5.3:编程与网安能力大跃升
智谱发布GLM-5.3,743B参数模型,编程能力达开源SOTA。网络安全能力涌现,基准得分是GLM-5.2两倍多。全部提升来自后训练缩放,还自研Z.ai Code Bench评估,安全评估加固后权重将开源。
AIGC开放社区
推荐文章8
Kevin Ding:未来选Agent要看近30天成长
本文是对火思动力创始人Kevin Ding的专访。他指出当下Agent会工作但不会成长,而如今市场需求、技术条件和数据供给成熟,可开展持续学习。他还阐述了后训练、产品应用、商业化等方面观点。
甲子光年
新闻资讯8
小米MiMo-V2.5:架构训练推理协同破大模型难题
2026年7月ICML大会上,小米MiMo团队负责人罗福莉介绍MiMo - V2.5系列。该系列跳出传统思路,从架构、训练、推理协同设计,实现“聪明、快速、便宜”,如预训练降成本、后训练有硬核算法、推理加速达1000 TPS。
AI科技评论
推荐文章7
AutoResearch-LLM:Agent 接手 LLM 训练优化
本文是 LLM 微调 AutoResearch 落地实战。作者将电商场景 Qwen3 微调流水线沉淀成 Agent 驱动的三阶段框架,还分享踩坑经验。思路方法与平台无关,可类比到外部环境,适合关注 AI Coding 等的同学。
阿里云开发者