阿里QwenLong-32B」共找到 637 篇相关文章

开源动态8

开源Qwen一周连刷三冠,暴击闭源模型!基础模型推理编程均SOTA

通义千问卷疯了,Qwen3-Coder刚登场,全新开源Qwen3系列最强推理模型Qwen3-235B-A22B-Thinking-2507又刷新SOTA。一周内,通义千问完成开源三连,在基础模型、编程模型、推理模型方面均达全球开源最强。

量子位
开源动态8

WAIC抢先爆料:金融“黑马”大模型超DeepSeek刷新SOTA,论文已上线

WAIC期间,蚂蚁数科金融推理大模型发布会未开,论文已上线。其新模型Agentar - Fin - R1有8B和32B版,在金融测评集超DeepSeek等,还兼顾专业与通用,蚂蚁数科还提出评测基准Finova。

量子位
算法论文8

Qwen&清华团队颠覆常识:大模型强化学习仅用20%关键token,比用全部token训练还好

Qwen与清华LeapLab团队研究发现,大模型强化学习训练推理能力时,仅20%高熵token就能撑起效果,甚至超全部token训练。团队用此在Qwen3-32B创造新SOTA记录,还探讨了强化学习的相关特性。

量子位
新闻资讯7

Qwen 3-235B Aider编程能力击败Claude3.7,成本便宜百倍

Qwen3-235B-A22B在Aider多语言编码基准初步测试中击败Sonnet 3.7 Thinking和OpenAI o1,成本便宜150到600倍。Qwen3-32B准确率超GPT-4.5和GPT-4o ,代码编辑格式正确率达100%。

AI寒武纪
新闻资讯7

林俊旸离职后首次发声!复盘千问的弯路,指出AI的新路

林俊旸离职阿里千问后发声,反思千问技术路线,认为千问合并两种模式未做好。他指出推理时代已过,未来是智能体时代,智能体思考将成主流,还阐述了其与推理思考区别及面临的挑战。

量子位
新闻资讯8

这次,钉钉领先半目

钉钉发布会前,阿里成立Alibaba Token Hub事业群,设悟空事业部,钉钉归入其下。无招回归后思考AI时代钉钉形态,革故鼎新,推出真经系统等,在制造业案例展现优势,强调可编程企业概念,悟空有望带来新商业想象。

乱翻书
开源动态8

小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一

6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。

AI前线
产品应用8

MoE不够看了,腾讯推出MoT:2B具身模型22项评测16项最佳

腾讯混元团队联合Robotics X实验室推出HY - Embodied - 0.5系列基础模型,含MoT - 2B和MoE - 32B两款主力模型。在22项评测中,MoT - 2B获16项最佳,其架构、数据和训练有创新,能应用于机器人控制。

量子位
开源动态7

LM Studio宣布支持在Mac上跑Qwen3-Next 80B模型

LM Studio宣布支持基于MLX框架在Mac上运行阿里Qwen3-Next 80B模型。该模型虽总参数量达800亿,但每次推理仅激活30亿。第三方评测显示其4bit量化运行效果好,不过实现GGUF格式支持尚需时间。

AI工程化
开源动态8

让强化学习快如闪电:FlashRL一条命令实现极速Rollout,已全部开源

清华AIR、字节联合团队曾发布DAPO实现大规模LLM强化学习。刘力源、姚峰团队发现DAPO-32B中rollout生成是瓶颈,推出FlashRL,应用INT8/FP8,用TIS解决不匹配问题,加速显著且不牺牲性能,一条命令即可使用。

机器之心