算法论文8
DeepSeek V3:大模型训练推理新突破
AIGC开放社区
AI 摘要
DeepSeek:发布开源模型V3论文,用DeepSeek - MoE、多头潜在注意力等技术,解决大模型内存、计算效率等问题,还提出硬件设计建议及优化网络方案,提升训练和推理性能。
阅读原文 · AIGC开放社区
DeepSeek发布最新论文,5大杀手锏让大模型训练、推理暴涨
全球著名开源大模型平台DeepSeek在huggingface发布超强开源模型V3的论文,从硬件架构和模型设计双视角探讨高效训练和推理,提出DeepSeek - MoE、多头潜在注意力等创新技术,解决内存、计算效率等难题。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
阿里Qwen3.8-Flash发布,性价比惊人!
8月大模型厂商多上调API价格或收缩免费额度,因推理需求增长跑赢算力供给。阿里发布Qwen3.8-Flash并开源,成绩亮眼且价格低。它是Qwen4架构预演,有四大技术创新,提升了模型效率。
机器之心
新闻资讯8
OpenAI自研芯片性能超英伟达,2026年部署
8月25日,OpenAI公布自研推理芯片Jalapeño性能测试结果,首次给出其在多款公开大模型上的具体数据。该芯片在低功耗下实现高推理吞吐量和低延迟,性能超英伟达芯片,B0版已进入制造阶段。
DeepTech深科技
新闻资讯8
DeepSeek高毛利,冲刺5000亿估值A股上市
据外媒报道,DeepSeek今年前七个月营收约4.75亿,较2025年全年增长近10倍,净亏损收窄,综合毛利率44.6%,API业务毛利率达82.9%。它正磋商500亿二轮融资,筹备明年沪上市,靠优化基建降本,低价策略吸客。
AI前线
算法论文8
颜见智团队:启发学习让大模型自我进化
当下大模型能力多靠人为框架,能力上限受限。文章提出“启发学习”,将其集成到推理侧成Isaac框架,通过Prompt与网络层注入复用旧经验,实验显示能大幅提升大模型任务性能。
机器之心