「Qwen3-Coder-Next」共找到 435 篇相关文章
The Batch: 849 | 用于训练网页智能体的生成数据
开发网页智能体常需大量人力标注训练样本,卡内基梅隆大学与亚马逊团队实现训练数据生成自动化。他们构建数据集,通过智能体工作流程生成数据,微调后 Qwen3 - 1.7B 表现出色,还公开数据与方法。
如何重现 DeepSeek 推理性能突破
DeepSeek-V3 是热门开源大模型,采用大规模 MoE 架构,优化推理性能是工程难点。阿里团队在 RTP - LLM 完成优化,对齐其推理系统性能,分享关键技术、不足与思考,还提及对 Qwen3 模型的优化策略。
2026夏季崇礼论坛五大看点,AI如何走进生活|甲子光年
2026年9月12 - 13日,2026夏季崇礼论坛将在崇礼·太舞小镇举行,主题为“未来此刻”。有五大看点,包括俞敏洪等探讨AI能力与入口,揭晓“AI NEXT 20”榜单,多场硬件、内容等相关圆桌及产品展示。
夸克 AI 对话助手的邪修打开方式:一句话直通网盘,看电影、找资料全拿下
阿里“C计划”首个成果,夸克App深度整合对话助手,用Qwen3 - Max模型。可随意切换模式,其独特之处是提问资料或电影,能直返夸克网盘链接,“搜、用、存”一气呵成,与其他AI助手不同。
性能比肩Gemini 3 Pro!昨晚,阿里千问最强模型来了
1月26日深夜,阿里千问旗舰推理模型Qwen3 - Max - Thinking上线,综合性能对标GPT - 5.2与Gemini 3 Pro。它突破传统推理方式,有自适应工具调用能力,助其在企业级AI竞争中领先。
我让10个大模型又参加了完整版数学高考,第一名居然是它。。。
作者让10个大模型参加完整版数学高考,单独制定规则,邀朋友协助测试。结果令人意外,单选题第6题成噩梦,多模态题大模型几乎全军覆没。讯飞星火和豆包145分并列第一,Qwen3屈居第三。
Hybrid Model Support:阿里云 Tair 联合 SGLang对 Mamba-Transformer 等混合架构模型的支持方案
文章介绍阿里云 Tair KVCache 团队与SGLang社区在推理框架上支持混合架构模型的工程化实践。分析混合架构崛起原因、面临挑战,阐述内存管理、关键技术优化方案,验证性能,并指出未来演进方向。
从GPT-2到gpt-oss,深度详解OpenAI开放模型的进化之路
OpenAI 近日发布 gpt-oss-120b 和 gpt-oss-20b 两个开源模型,Sebastian Raschka 发布博客对其详细分析,回顾自 GPT - 2 以来 AI 社区进步,还与 Qwen 3 比较,介绍架构、训练、推理等细节。
林俊旸Agent创业首次亮相,腾讯已投
前Qwen一号位林俊旸官宣创业公司Pragmatik Labs,方向为做横跨数字与物理世界的下一代Agent。公司获高榕、红杉、腾讯等投资,投后估值达20亿美元。虽无产品模型,但凭借林俊旸过往成绩受关注。
首个开源实现100%可复现的稳定RL训练框架来了!2次结果完全重合
SGLang团队联合slime团队开源实现100%可复现的稳定RL训练框架。基于Qwen3 - 8B重复实验结果完美重合。SGLang在批次不变算子基础上实现确定性推理,性能有下降但有提升空间,还给出使用方法和未来规划。