Deepseek架构」共找到 2361 篇相关文章

产品应用7

实测美团 LongCat:快到极致,但是别说追平 DeepSeek

AI科技评论实测美团LongCat-Flash-Chat,它是中量级对话模型,主打“快”,几乎零延迟。但在推理、抗污染能力等测试中,相比DeepSeek-V3.1,逻辑链条松散,缺乏清晰判断。速度与逻辑哪个更重要,值得思考。

AI科技评论
新闻资讯7

图解GPT-OSS:架构、消息格式与推理机制等

OpenAI发布首个开源大模型GPT-OSS,虽性能无惊喜,但设计思路有意思。其架构是经典延续,消息格式有巧思,支持三档推理模式,分词器有小进步,这些设计在实际应用和理论上有一定价值。

AI工程化
开源动态8

全网开测GPT-oss!技术架构也扒明白了

全网开测GPT-oss,它登顶开源模型王座,性能比肩o3-mini、o4-mini,适合本地推理。网友探索出多种用法,还推出Pro版。其架构也被扒出,官方介绍了微调方法,吴恩达等大佬也参与测评。

量子位
产品应用8

百度 TURA 三阶段架构:让 AI 检索 “动” 起来

现有检索增强生成(RAG)系统只能读取已索引的静态网页,无法满足用户实时数据需求。百度 TURA 架构用工具调用将 RAG 升级为动态交互,分检索、规划、执行三阶段,已在百度亿级流量场景跑通。

CourseAI
新闻资讯7

刚上市的摩尔线程,即将揭晓新一代GPU架构

2025年12月19 - 20日,摩尔线程首届MUSA开发者大会将在北京举行。大会聚焦国产全功能GPU,主论坛将揭晓新一代GPU架构,还有超20场技术分论坛及1000㎡科技嘉年华,诚邀各方共筑智能计算生态。

机器之心
新闻资讯7

DeepSeek V3.2爆火,Agentic性能暴涨40%解密

文章解密了DeepSeek V3.2 Agentic性能暴涨40%的原因,即采用交错思维链机制。还对比了其与早期ReAct范式,介绍其效果、原理,以及MiniMax为落地该机制做的工作,最后提到多家模型达成技术共识。

新智元
新闻资讯7

DeepSeek涨价,OpenAI降价,Agent改写了大模型价格战

近期,DeepSeek上调API价格,V4 Pro等型号涨幅明显;而OpenAI的GPT - 5.6 Luna API价格降80%,Terra降20%。这背后是大模型价格竞争方向转变,受竞争、广告、效率及Agent使用方式等因素影响。

DeepTech深科技
产品应用7

Spring AI 实战|Spring AI入门之DeepSeek调用

文章介绍Spring AI框架,它简化企业数据或API服务与大模型集成,降低开发复杂度。还给出调用DeepSeek的实战步骤,包括手动请求、代码自动发起、实现流式响应等,也提及OpenAI starter的兼容性及生产环境监控。

阿里云开发者
产品应用7

更省 Token 的国产 Codex:ZCode,加上 DeepSeek 更夯!

介绍国产 Codex 平替 ZCode,它有 100 万用户,能接 DeepSeek,模型选择开放,缓存命中率高省 Token,插件生态完善,还介绍了安装、接入方法及多种实用功能。

AI产品自由
开源动态7

野生DeepSeek火了,速度碾压官方版,权重开源

近日,德国AI咨询公司TNG推出的「DeepSeek R1T2」模型火了,速度比R1快20%,性能不弱于R1。它采用AoE技术,融合官方三大模型,开源且在Hugging Face开放权重,获不少人期待。

机器之心