DeepSeek-V4-Flash」共找到 773 篇相关文章

开源动态7

智谱新模型也用DeepSeek的MLA,苹果M5就能跑

智谱AI上市后发布新成果,开源轻量级大语言模型GLM-4.7-Flash,API免费开放调用。该模型是30B总参数、3B激活参数的MoE架构,定位为“本地编程与智能体助手”,评测表现佳,采用MLA架构,多平台支持。

量子位
新闻资讯7

“你以为买的是 DeepSeek Flash,到手可能是 1.5 bit 缩水版”:Pi 核心贡献者谈 AI Token 黑箱

Pi 核心贡献者 Armin Ronacher 与 Modem 联合创始人 Ben Vinegar 播客对谈指出,当前 AI token 市场不透明,模型公司或失控。如买 token 像买成分不明商品,模型训练目标不明,且 Agent 行为边界在扩展,问责制缺失。

InfoQ
推荐文章7

DeepSeek-R1发布100天后:全面复盘推理大模型复现研究及未来!

推理语言模型(RLMs)发展显著,DeepSeek - R1发布引发广泛影响且未完全开源。MiroMind等总结其复现研究,关注SFT和RLVR方向,介绍数据构建、方法设计、训练过程细节及实验关键发现。

PaperAgent
新闻资讯7

究竟会花落谁家?DeepSeek最新大模型瞄准了下一代国产AI芯片

近期,DeepSeek发布V3.1新模型,采用全新混合推理架构,在多任务表现上有提升。它采用UE8M0 FP8,或为国产推理芯片优化机制。国内多家厂商新一代AI芯片支持FP8,未来国产大模型或针对其专门优化。

机器之心
新闻资讯8

DeepSeek-R1登顶Nature,8位专家严审通过, 大模型「交卷时刻」来了

近日,DeepSeek - R1登上Nature封面,打破主流大模型未经过独立同行评审惯例。同行评审可理清模型机制,提升透明度与可信度,还能避免‘刷榜’‘自评’,虽有公司担心泄密,但它是验证成果的必要程序。

新智元
开源动态8

碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强

国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。

AIGC开放社区
算法论文7

谷歌新发现:DeepSeek推理分裂出多重人格,左右脑互搏越来越聪明

谷歌研究表明,DeepSeek - R1等顶尖推理模型解题时,内部会自发“分裂”出不同性格虚拟人格,像在进行社交、辩论会,且越“吵”越聪明。团队借助SAE解码其脑内群聊,还发现‘哦!’能提升推理准确率。

量子位
新闻资讯8

Google 发布 Gemini 3.1 Flash-Lite:每秒 363 tokens,百万 token 只要 $0.25

Google发布Gemini 3.1 Flash-Lite,输出速度达363 tokens/秒,比上一代快45%,首个token响应快2.5倍。价格降低,输入$0.25/百万tokens,输出$1.50/百万tokens。跑分不错,还有动态思考功能,支持多模态输入。

AGI Hunt
7

DeepSeek V4永久降价!缓存命中再打1折,实测编程成本骤降83%

DeepSeek两天连续两次降价,输入输出2.5折,命中缓存输入折上再1折且无时限。实测编程成本骤降83%,此前31.73元,打折后只需5.34元。其曾引发价格战,此次对海外用户冲击更大。

量子位
开源动态7

小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek

小米开源 MiMo-V2.5 和 MiMo-V2.5-Pro 两款模型,采用 MIT 协议,适合商业应用。在基准测试中表现出色,有竞争力价格和限时优惠。但与 DeepSeek 比,架构创新偏工程化,也有推理表现不足等问题。

AI前线