Deepseek架构」共找到 2361 篇相关文章

算法论文8

重磅!DeepSeek R1论文经过同行评议登上Nature封面,梁文锋作为通讯作者再次创造历史

DeepSeek R1论文《DeepSeek - R1 incentivizes reasoning in LLMs through reinforcement learning》登上Nature封面,梁文锋为通讯作者。它是首个经同行评议的有全球影响力的LLM,训练成本低,创新使用‘纯粹强化学习’方法,启发众多研究。

AI寒武纪
算法论文7

AIAAJ | 西工大张巧、张伟伟等:多专家特征融合网络架构预测跨声速抖振气动噪声

为解决气动噪声数据中流动状态与空间位置分布不平衡导致的MLP预测精度不足问题,本研究提出多专家特征融合网络架构,以跨声速抖振气动噪声为算例评估,可降低MLP算法MSE,泛化性更好。

力学与人工智能
开源动态8

谷歌T5Gemma重燃架构之战!「套壳」反杀Gemma本尊,9B推理快得离谱

2023年以来大模型战场由decoder - only架构主导,Google双线出击。T5Gemma重燃encoder - decoder架构战火,性能提升显著;MedGemma坚守decoder - only路线,强攻医疗多模态,击穿闭源壁垒,打响开源反击战。

新智元
新闻资讯8

Karpathy盛赞DeepSeek-OCR“淘汰”tokenizer!实测如何用Claude Code 让新模型跑在N卡上

DeepSeek发布新模型DeepSeek - OCR,有诸多技术贡献,获Karpathy等盛赞。它或让文本token输入方式被淘汰。开发者Simon用Claude Code让其在N卡上运行成功,分享了详细过程与经验。

AI前线
算法论文8

腾讯混元TurboS技术报告首次全公开:560B参数混合Mamba架构,自适应长短链融合

腾讯公开混元TurboS技术报告,该模型是超大型Hybrid Transformer - Mamba架构MoE模型,融合Mamba与Transformer架构优势,有自适应长短思维链机制,激活参数56B。在多评测中表现佳,推理成本低。

AI前线
算法论文8

为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本

近年来大模型推理开销增长,MoE架构虽能避免计算量同比增,但带来扩展性差、容错性低、负载不均等问题。为此作者提出全新「专家即服务」推理架构EaaS,实验显示它能锐减37.5%成本。

机器之心
新闻资讯8

见证历史!DeepSeek跃居全球第二AI实验室,R1登顶开源王座,R2全网催更

昨晚,DeepSeek官宣R1完成小版本升级,开启「深度思考」功能可体验。其R1-0528性能媲美o3和Gemini 2.5 Pro,还微调了8B模型。DeepSeek成全球第二大AI实验室和开源王者,网友催更R2。

新智元
产品应用7

刚刚,DeepSeek-V3.1「终极版」重磅发布!最大提升超36%,V4/R2还远吗?

DeepSeek最新模型DeepSeek-V3.1-Terminus发布,解决了此前输出随机带「极」字、中英文混杂等问题,在多个基准测试中成绩提升,最大提升超36%,Agent能力也有进步,还引发网友对V4/R2的期待。

新智元
产品应用8

还得是华为!Pangu Ultra MoE架构:不用GPU,你也可以这样训练准万亿MoE大模型

华为盘古团队发布Pangu Ultra MoE模型架构与训练方法的中文技术报告。该模型全流程在昇腾NPU上训练,团队在架构和训练方法创新,实现准万亿MoE模型训练,还在多方面优化提升性能。

机器之心
产品应用7

Claude Code 实战横评:GLM4.5 vs DeepSeek 3.1(附Windows MCP配置,免费模型接入)

文章对Claude Code里GLM4.5和DeepSeek 3.1进行实战横评,涵盖数据库、网站、游戏等测试案例。还介绍Claude Code在Windows下配置MCP经验,以及接入GLM、Deepseek等模型的方法和免费平台。

AI进修生