「DeepSeek V3/R1」共找到 2729 篇相关文章
Qwen3又又又发布了新模型~~~
Qwen3团队继发布`Qwen3-235B-A22B-Instruct-2507`和`wen3-235B-A22B-Thinking-2507`后,又发布`Qwen3-Coder-30B-A3B-Instruct`。该简化模型性能和效率出色,有多项关键增强功能,且是非思考模型,输出效率高。
个人开发者训400亿参数大模型:分布式算力,DeepSeek架构,3090单卡部署
Nous Research推出Psyche Network,可整合全球算力训练AI。它基于Deepseek的V3 MLA架构,有DisTrO优化器等技术,能让个人和小团体创建大规模模型,还实现40B参数LLM预训练。
英伟达开源9B参数小模型,比Qwen3快6倍
英伟达推出新型小型语言模型Nemotron Nano v2,在复杂推理基准测试上准确率与Qwen3 - 8B相当或更高,速度快6倍。它兼顾推理与非推理任务,支持“思考”预算控制,还开源了创建模型的绝大部分数据。
Gemini 3+Nano Banana Pro+3D 生成+手势控制=?藏师傅教你炫酷展示运动成果
作者作为户外运动爱好者,用Nano Banana Pro做户外运动成果展示的图片提示词和海报效果佳,还将图片转3D模型、加手势控制,文章分享制作方法、提示词及工具使用方式。
3D高斯泼溅,可输入视图量高达500!推理速度提升3倍,内存少80%
ZPressor能高效压缩3D高斯泼溅(3DGS)模型的多视图输入,解决其在处理密集视图时的性能瓶颈。它基于信息瓶颈原理,分三步压缩信息,降低内存占用和推理时间,提升3DGS在高视图输入下的性能。
清华系团队出手!一张 4090 即可「爆改」,1.3B小钢炮震撼开源
5月11日,清华系团队面壁智能联合多方开源端侧多模态大模型MiniCPM-V 4.6。它参数仅1.3B,性能超阿里、谷歌等同级对手,效率翻倍,还实现两项架构创新,适配主流开源生态,降低开发门槛。
DeepSeek被曝融资20亿…可幻方一年就挣50亿啊?
DeepSeek被曝计划首次融资,目标估值超100亿美元,计划融资至少3亿美元。但此前多次融资传闻均被辟谣,且其母公司幻方量化盈利能力强。若融资,或为锚定股权价值、激励人才及获非财务价值。
全球最强开源「定理证明器」出世!十位华人核心,8B暴击671B DeepSeek
八大顶尖机构推出开源定理证明器Goedel - Prover - V2,有32B和8B两版本。它在多个基准测试击败671B的DeepSeek - Prover,采用创新技术,以少算力刷爆SOTA,十位华人是核心贡献者。
国产AI视频炸了!SkyReels-V3三大功能重磅开源,1张图生成逼真视频
昆仑天工SkyworkAI团队开源多模态视频生成模型SkyReels-V3,它能在一个架构内搞定参考图像转视频、视频延长、音频驱动虚拟形象三大核心能力,超越主流商业模型,且真正开源。
DeepSeek流量暴跌?AI大模型全球霸主离奇遇冷,外媒曝出真相
曾以低价高性能出圈的DeepSeek,在自家平台遇冷、市场份额下滑,但其R1和V3模型在第三方平台使用量增长近20倍。背后是‘Token经济学’及战略转移,它开源模型,将算力留作研发。Anthropic也因算力受限有类似问题。