DeepSeek系列模型」共找到 7948 篇相关文章

推荐文章8

最新AI眼镜格局报告:百镜大战拉开序幕,阿里DeepSeek高通成幕后赢家

量子位智库推出《AI眼镜「预选赛」格局报告》,分析AI眼镜市场。从产品到技术,如大模型通义千问、DeepSeek成赢家,高通骁龙AR1受青睐,还探讨了各类型AI眼镜趋势、玩家构成等。

量子位
算法论文8

梁文锋署名!DeepSeek再发炸裂论文:提出“条件记忆”新范式,彻底打破GPU推理显存墙

来自DeepSeek的新论文提出“条件记忆(Conditional Memory)”新范式,推出Engram模块,实现可扩展知识查找。研究揭示U形缩放定律,构建的Engram模型性能超越纯MoE基线,还打破了GPU显存瓶颈。

AI寒武纪
新闻资讯8

梁文锋突袭马斯克!DeepSeek V4 Pro对战Grok 4.6,首测夯爆了

梁文锋凌晨发布DeepSeek V4 Pro正式版,马斯克推出Grok 4.6,二者在多项评测中表现出色,直逼OpenAI和Anthropic顶尖模型,还降低了前沿智能价格。首测中,二者在真实任务场难分伯仲。

新智元
算法论文8

DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!

4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。

花叔
新闻资讯7

4B Qwen3逆袭671B DeepSeek!字节DAPO微调方法这么猛的吗

最新模型Jan - nano引发关注,它在智能体任务上超671B的DeepSeek - V3 0528,在SimpleQA基准获80.7分。它基于Qwen3 - 4B用字节&清华DAPO微调方法。其研发团队是Menlo Research,有开源产品和长远规划。

量子位
算法论文8

LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制

中国科学院自动化研究所与腾讯AI Lab团队,从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上表现优于传统算法。

PaperAgent
开源动态8

专为小说、角色扮演等而生:元象开源泛娱乐场景底座模型

元象作为AI与3D技术服务公司,此次开源XVERSE-Ent系列中英双语大模型。它采用MoE热启动技术与三阶段训练策略,解决泛娱乐场景痛点,适配多元语境,有高部署性价比,为行业提供泛娱乐AI解决方案。

AIGC开放社区
算法论文8

颜水成领衔,给AI分段位!超100款多模态模型,无人达到L5

十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。

新智元
开源动态7

美团也开源了大模型,但我觉得他们的野心是通用生活Agent。

美团发布并开源560B参数的MoE模型LongCat - Flash - Chat,推理速度快。与DeepSeek V3对比,输出速度优势明显。美团多个落地或内测AI功能服务C端生活场景,目标是打造通用生活Agent。

数字生命卡兹克
8

全网最强万字解读:DeepSeek-V4 掀翻了谁的桌子? | GAIR live 030

文章深度解读了DeepSeek-V4,从产业、生态和架构维度拆解其效率账本。它成本低,补齐短板适配昇腾芯片,但极致省钱也有代价,如性能衰减、架构复杂等。还探讨了长上下文、MoE与稠密模型路线差异及商业化潜力。

AI科技评论