DeepSeek模型」共找到 7818 篇相关文章

开源动态7

国产开源大模型:再见9月,你好10月~

9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。

PaperAgent
开源动态8

DeepSeek开源的不仅仅是个新OCR模型。。。

DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。

AI工程化
新闻资讯7

DeepSeek涨价,OpenAI降价,Agent改写了大模型价格战

近期,DeepSeek上调API价格,V4 Pro等型号涨幅明显;而OpenAI的GPT - 5.6 Luna API价格降80%,Terra降20%。这背后是大模型价格竞争方向转变,受竞争、广告、效率及Agent使用方式等因素影响。

DeepTech深科技
开源动态8

国产大模型持续开源的一周:DeepSeek、Qwen、字节、书生~

国产开源大模型持续发力,本周DeepSeek V3.1、字节Seed-OSS-36B等接连发布。此外,马斯克xAI正式开源Grok 2.5,英伟达也开源了Nemotron-Nano-9B-v2。PaperAgent专题进行了梳理盘点。

PaperAgent
开源动态8

公开模型一切,优于DeepSeek-R1,英伟达开源Llama-Nemotron家族

英伟达推出面向高效推理的 Llama-Nemotron 系列模型,包括 Nano、Super、Ultra 等规模,具备卓越推理能力与效率,采用开放许可。模型支持动态推理切换,训练结合多方法,性能优于 DeepSeek-R1 等。

机器之心
新闻资讯8

DeepSeek-R2尚未问世,微软小模型捡漏称王?6000样本炼出「数学作弊器」!

微软推出Phi-4推理模型系列,参数最多14B,能在本地高性能笔记本电脑上流畅运行。Phi-4-mini-reasoning在数学推理上性能超越DeepSeek-R1蒸馏模型,且参数规模更小。文章还介绍了模型特点、训练方法、性能表现及局限性等。

新智元
开源动态8

DeepSeek 模型技术之旅:从 V3 到 V3.2

本文深入剖析了 DeepSeek 模型从 V3 到 V3.2 的技术演进,对比了基座与推理模型,介绍了架构、训练方法变化,如 V3.2 结合 MLA 与 DSA,更新奖励和 GRPO 算法,还提及 V3.2-Speciale 扩展思考特性。

深度学习自然语言处理
新闻资讯8

刚刚,「欧洲的DeepSeek」发布Mistral 3系列模型,全线回归Apache 2.0

Mistral AI发布Mistral 3系列开放模型,含Ministral 3和Mistral Large 3,均采用Apache 2.0许可证。该系列模型性价比高,性能出色,还与多方合作。其发布或标志欧洲重返AI竞赛,也是对DeepSeek的追赶。

机器之心
开源动态8

王兴一鸣惊人!美团首个开源大模型追平DeepSeek-V3.1

美团首个开源大模型Longcat-Flash-Chat发布即引发热议。它在部分benchmark上超DeepSeek-V3.1等,编程能力也出色。技术报告透露美团对大模型的理解,还有新发现,且性能好、训练效率高。

量子位
新闻资讯7

热议!DeepSeek V3.1惊现神秘「极」字Bug,模型故障了?

DeepSeek 最新的 V3.1 模型上线不到一周,因离奇 Bug 引发社区热议。无论执行何种任务,模型总会在文本中插入「极」字,自我修复时也无法避免,还存在多语言混用问题,网友猜测原因多为「数据污染」。

机器之心