DeepSeek 671B」共找到 1374 篇相关文章

开源动态8

The Batch:820 | Qwen3 向 DeepSeek-R1 发起挑战

阿里巴巴发布八个大型语言模型权重,含两个 MoE 架构和六个稠密模型。预训练数据达 36 万亿 token,支持 119 种语言及方言。测试中 Qwen3 家族表现出色,或终结 DeepSeek - R1 霸主地位,设计用于智能体系统。

DeeplearningAI
新闻资讯7

揭密MiniMax不为人知的B

第一批AI大模型公司上市潮来临,MiniMax营收增长显著。它采用“B+C全都要”商业模式,B端业务靠API调用,覆盖多领域,毛利率高。其B端战略分三层,靠全模态布局和模型能力扩张版图。

芯师爷
新闻资讯7

The Batch: 930 | DeepSeek 放弃 Nvidia 转向华为

中国开源权重模型开发者 DeepSeekDeepSeek-V4 最新更新中未给美国芯片厂商适配机会,却向华为提供预发布版。美国限制出口芯片反促中国发展本土芯片,该决定加深中美 AI 生态分裂。

DeeplearningAI
开源动态8

WAIC抢先爆料:金融“黑马”大模型超DeepSeek刷新SOTA,论文已上线

WAIC期间,蚂蚁数科金融推理大模型发布会未开,论文已上线。其新模型Agentar - Fin - R1有8B和32B版,在金融测评集超DeepSeek等,还兼顾专业与通用,蚂蚁数科还提出评测基准Finova。

量子位
开源动态7

The Batch:829 | DeepSeek 是怎么做到的

DeepSeek 去年末以低成本训练出先进开源大模型引关注,近日团队披露构建 DeepSeek - R1 和 DeepSeek - V3 的软硬件方案,降低内存和计算需求,其细节公布让更多团队有机会参与前沿研发。

DeeplearningAI
开源动态8

这 5 个 DeepSeek 开源项目,最近夯爆了!

几天前,DeepSeek发布开源智能体框架`DeepSeek Harness`,热度极高。围绕它社区长出丰富高星项目,本文整理了5个,如核心项目`DeepSeek Harness`、桌面客户端、Web UI插件、终端交互插件及插件导航手册。

开源先锋
开源动态8

DeepSeek 时刻” 一周年

本文回顾 2025 年 1 月 “DeepSeek 时刻” 后中国开源 AI 社区转折,分析其对全球开源生态的重塑。指出 DeepSeek R1 降低三门槛,推动战略转变,全球也积极应对新开源热潮。

Hugging Face
开源动态7

DeepSeek版Claude Code登顶热榜:8700星,鲸鱼哥火了

DeepSeek版Claude Code登顶GitHub热榜,Star量超8700且还在增长。DeepSeek TUI由Hunter Bown用Rust开发,能与DeepSeek深度集成,有多种模式,打破高价API限制,开发者是半路出家的程序员。

机器之心
产品应用8

DeepSeek-V3.2-Exp:用稀疏注意力打破长文本效率瓶颈

在NLP领域,处理长文本时传统注意力机制效率低。DeepSeek团队推出DeepSeek-V3.2-Exp模型,引入稀疏注意力机制,在保持性能同时提高长文本处理效率,降低计算复杂度,在多基准测试中表现良好。

CourseAI
新闻资讯8

梁文锋、马斯克同时开火!DeepSeek V4 Pro,Grok 4.6 发布

刚刚,DeepSeek悄悄上线DeepSeek V4 Pro正式版,马斯克高调推出Grok 4.6,两者性能直逼顶级闭源甚至有超越。每百万输出Token,Grok 4.6和DeepSeek价格优势明显。两者在多项评测中表现出色,且后续还有大招。

AIGC开放社区