DeepSeek - V3」共找到 984 篇相关文章

新闻资讯7

利润腰斩也要卷AI!小米模型永久降价99%,雷军还要再砸600亿

今日小米宣布 MiMo-V2.5 系列 API 永久降价,最高降 99%,Token 额度提升。虽 2026 年 Q1 财报显示利润腰斩、营收下滑,雷军仍称今年 AI 投 160 亿,未来三年投 600 亿。此前 DeepSeek 也已降价,中国大模型在 OpenRouter 表现亮眼。

AI前线
新闻资讯7

人民想念DeepSeek

文章探讨AI时代Token相关问题。指出其消耗大、价格贵,存储价格上涨使Token降价缺杠杆,虽模型能力提升、MFU优化可降本,但传导到C端取决于商业考量。还回顾大模型价格战,介绍本地部署及芯片创新方案。

芯师爷
新闻资讯8

陈大年复出,入局大模型

国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在信通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。

量子位
算法论文7

《TAML》好文推荐 | 来自中国科学院力学研究所张磊博士 评估大语言模型在计算流体力学领域的知识利用、学习与创造

研究聚焦评估推理型(DeepSeek R1和OpenAI o3 - mini - high)与非推理型(DeepSeek V3和ChatGPT 4o)大语言模型在计算流体力学领域知识利用、学习与创造能力。通过三类基准问题评估,结果有差异。

力学与人工智能
开源动态7

上新:Cache-DIT 支持LTX-2模型

作者和DefTruth在Cache-DIT上支持了LTX-2模型,记录适配关键点,包括模型侧、框架侧适配。介绍LTX-2特点,如支持T2V/I2V、输出带音频,还说明Cache-DIT加载区分T2V/I2V方法及cache侧修改内容,最后给出使用示例。

GiantPandaLLM
算法论文8

为什么这篇谷歌论文被称为「Attention is all you need」V2

谷歌新论文《嵌套学习:深度学习架构的幻象》引发关注,被称为「Attention is all you need」V2。它指出主流优化器是关联记忆系统,提出嵌套学习范式,构建HOPE架构,为AI设计带来新思考框架。

量子位
产品应用7

CAI+DeepSeek渗透测试情况及扩展分析

文章对CAI+DeepSeek进行渗透测试。介绍CAI安装,在kali按Ubuntu指令装,使用界面友好。测试中CAI执行指令彻底灵活,扫描分析到位。还提及CAI多种能力,称其作为开源框架全面细致,值得研究。

AI与安全
开源动态8

Mistral 3开源,一举超越DeepSeek与K2?

近期,Mistral AI开源Mistral 3,含三款小型稠密模型及Mistral Large 3。Benchmark对比中,它领先国内DeepSeek - 3.1、Kimi - K2。Mistral Large 3是强开源权重模型,Ministral 3适合边缘端,成本性能比低。

PaperAgent
新闻资讯7

600万奖池尘埃落定,有人靠DeepSeek网页版拿下冠军

TAAC × KDD Cup 2026大赛落幕,600万奖池揭晓归属。大赛吸引52国13913名选手,竞争激烈。冠军团队分别用DeepSeek网页版等工具,在赛题“统一建模”难题上各展方案,其成果或助广告外的LLM研究。

机器之心
算法论文8

只用2700万参数,这个推理模型超越了DeepSeek和Claude

Sapient Intelligence研究者受大脑机制启发提出分层推理模型(HRM),该模型仅2700万参数、1000个训练样本,就在复杂推理任务上超越DeepSeek和Claude等模型,还引入近似梯度等创新设计。

机器之心