混合专家模型」共找到 7979 篇相关文章

开源动态8

阿里Qwen3技术报告核心要点解读!

阿里Qwen3技术报告发布,披露模型架构、预训练及后训练等技术细节。其有密集与混合专家两种模型架构,预训练数据量和语种增多,后训练采用强到弱蒸馏提升性能,各模型表现优异。

PaperAgent
开源动态8

腾讯混元推出首款开源混合推理模型:擅长Agent工具调用和长文理解

6月27日,腾讯混元开源首个混合推理MoE模型Hunyuan - A13B,参数80B激活仅13B,推理快性价比高。它在多测试集成绩好,尤其擅长Agent工具调用和长文理解,还开源两数据集填补评估空白。

AI前线
算法论文7

deepseek-V4算法工程技术深入浅出

文章围绕deepseek V4技术报告展开,指出当前大模型训练不充分,介绍了算法层面如混合注意力机制、模型结构优化、优化器等,工程层面如细粒度专家并行、算子内核开发等,以及后训练的范式转变和领域专家网络蒸馏等内容。

Agent的潜意识
算法论文8

首次!世界模型、动作模型融合,全自回归模型WorldVLA来了

阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。

机器之心
算法论文8

MIT新研究:大模型加噪声就能替代GRPO/PPO调参

MIT新论文提出,预训练模型周围存在大量“专家模型”,只需添加高斯噪声并集成,性能就能比肩甚至超越GRPO/PPO等调参算法。由此启发了RandOpt算法,经测试准确率不错,但也有依赖预训练等缺点。

量子位
产品应用8

融合风控知识的大模型体系建设与应用实践

腾讯算法专家欧阳天雄在AICon大会分享《大模型驱动下的智能风控落地实践》,介绍腾讯天御融合海量风控知识构建金融风控大模型,解决传统风控模型难题,还展示构建技术、工程实践及落地案例,为金融风控提供新思路。

InfoQ
新闻资讯7

OpenAI研究大模型对GDP贡献,三大行业已能代替人类,并自曝不敌Claude

OpenAI推出新评估方法GDPval,跟踪模型在现实任务表现。评估显示前沿模型接近专家水平,Claude Opus 4.1表现最佳,GPT - 5准确性出色。还发布黄金子集和评分服务,其处于起步阶段将持续扩展。

机器之心
新闻资讯7

OpenAI Astra被曝引入「循环深度」能力飙升!安全专家坐不住了

OpenAI 最强新模型 Astra 或即将发布,它是首个达「关键级」网络安全能力门槛的模型,在测试中表现优异。《The Information》爆料其用「循环深度」技术,能力提升但引发安全专家担忧,该技术可使模型内部计算增多,思维链监控或失效。

机器之心
开源动态8

开源医疗模型SOTA:蚂蚁健康发布百亿参数医疗大模型

由浙江省卫生健康信息中心、蚂蚁健康等联合开发的AntAngelMed医疗大模型正式开源。它凭借独创训练与架构,在权威评测中表现优异,降低算力门槛,将专业知识、诊疗能力与计算架构融合,为医疗AI落地奠基。

AIGC开放社区
新闻资讯8

0.027B手机AI模型,估值2亿美金,三个清华学霸如何获得国际大学生创新大赛冠军

10月15日,清华万格智能团队“基于类脑架构的下一代通用模型与智能体生态”获中国国际大学生创新大赛(2025)冠军。团队由三个清华本科生创立,此前已完成融资,估值达2亿美元。其智人HRM模型有诸多优势,还研发出顶尖气候预测专家模型

AIGC开放社区