开源动态7
Qwen3再发新模型,性能效率双优
CourseAI
AI 摘要
Qwen3团队爱用MoE,继之前模型后又发布`Qwen3-Coder-30B-A3B-Instruct`。此简化模型性能效率佳,有编码等关键增强功能,非思考模型输出快。
阅读原文 · CourseAI
Qwen3又又又发布了新模型~~~
Qwen3团队继发布`Qwen3-235B-A22B-Instruct-2507`和`wen3-235B-A22B-Thinking-2507`后,又发布`Qwen3-Coder-30B-A3B-Instruct`。该简化模型性能和效率出色,有多项关键增强功能,且是非思考模型,输出效率高。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Ilya新模型或成今年最重要发布
a16z合伙人Martin Casado预告今年最重要的模型发布,线索指向Ilya Sutskever的新模型。SSI成立两年低调发展,获巨额融资,7月与英伟达合作。持续学习是焦点,但相关能力信息有限。
机器之心
新闻资讯7
Claude新模型实测流出,性能与算力双惊人
Claude两款新模型“棉花糖”和“甜瓜”实测流出,在3D强化学习和建筑空间布局上性能强大,还能直接理解并生成复杂3D坐标和空间关系。它们对算力吞噬疯狂,引发对其身份的猜测。
新智元
新闻资讯7
DeepSeek缓存涨价11倍,开发者需提命中率
8月17日,DeepSeek V4 Pro API输入和输出价格上涨,空闲时段缓存命中价涨5倍,高峰时涨11倍。此前其因高缓存命中率成性价比之选,但长上下文需求爆发致后端“缓存颠簸”,只能通过涨价收“存储税”。开发者可提高缓存命中率应对。
AI科技评论
算法论文8
COLM三篇论文暴击Transformer祖传设计
COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理。
量子位