DeepSeek 671B」共找到 1377 篇相关文章

开源动态7

DeepSeek开源MoE新利器LPLB:基于线性规划,专攻训练动态负载不平衡

DeepSeek在GitHub开源LPLB,这是基于线性规划的并行负载均衡器,用于优化MoE模型专家并行工作负载分配。它通过动态重排序、副本构建等机制实现动态负载均衡,支持多种拓扑结构,但也存在成本估算等局限性。

AI寒武纪
新闻资讯7

扒开1604份招聘,DeepSeek们最狠的大招藏在招人里

Epoch AI调查6家中国AI公司1604个岗位,发现中国AI公司用人不重资历重能力,岗位集中在北京、杭州、上海,不同公司有不同业务侧重和发展方向,招聘启事暴露其战略布局。

新智元
算法论文7

OpenClaw的风刮到了多模态生成,6B小模型超越Nano Banana 2!

现在多模态生成模型在复杂指令和下游任务表现不佳。上海人工智能实验室等团队提出GEMS,将OpenClaw成功应用于多模态生成领域,激发小模型潜力,让6B小模型部分任务超越Nano Banana 2。

量子位
开源动态8

字节跳动开源视频生成模型Alive:12B参数,个人电脑也能跑

字节跳动开源视频生成模型Alive,12B参数,支持四种模式,硬件门槛低。在评测中表现出色,技术架构精心设计,解决音视频同步等问题,虽有小瑕疵,但更适合普通玩家。

AI工程化
开源动态7

两分钟Claude Code模型换成DeepSeek,立省17倍,缓存后爆省120倍

GitHub开源deepclaude,两分钟可将Claude Code模型换成DeepSeek V4 Pro,开销直降17倍。自带上下文缓存机制,重复对话成本降120倍。支持多后端选项,可丝滑切换,还能打破设备限制远程编程。

AIGC开放社区
算法论文7

DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案

DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。

机器之心
开源动态8

DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案

DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。

新智元
开源动态8

腾讯太极团队实现DeepSeek模型业内H20最高性能15800+ tokens/s

腾讯太极团队揭秘实现DeepSeek模型15800+ tokens/s业内H20最高性能的方法,通过PD分离、多层MTP优化等全栈优化方法论,还介绍多机性能优化方案,后续预计性能突破20000 tokens/s。

腾讯技术工程
开源动态7

DeepSeek研究员1200行代码复刻vLLM,H800硬件实测性能反超原版

DeepSeek研究员俞星凯搞出开源项目Nano - vLLM,仅用不到1200行代码实现最小化且完全可读的vLLM。它有快速离线推理、代码可读性强、含优化套件等特点,在H800硬件实测中性能反超原版vLLM。

量子位
新闻资讯7

2025年哪款模型最受欢迎?Poe最新报告:DeepSeek降温、可灵成黑马

AI工具聚合平台Poe发布2025年1 - 5月人工智能模型使用趋势报告。显示模型市场份额消长明显,推理模型势头正劲,图像、视频、音频生成领域各有竞争态势,如DeepSeek降温,可灵成视频生成黑马。

Founder Park