「Deepseek架构」共找到 2361 篇相关文章
扎克伯格发文正式告别“默认开源”!网友:只剩中国 DeepSeek、通义和 Mistral 还在撑场面
Meta 首席执行官扎克伯格分享“个人超级智能”愿景,透露公司调整 AI 模型发布策略。此前 Meta 强调开源优势,如今态度转变,巨额投入后或暂停开源新模型,计划并行训练开源与闭源模型。
黄仁勋交流会万字实录:谈中美芯片、H20、CUDA兼容,点赞DeepSeek、Qwen和Kimi
英伟达CEO黄仁勋在华媒交流会上称,中国供应链发达、AI人才多、电动汽车发展出色,H20芯片解禁,英伟达会继续投资。他还谈到CUDA兼容、中美贸易等问题,鼓励年轻人投身AI。
DeepSeek推理最高提速6倍!开源研究:加装「思维进度条」,计算量减少30%
特拉维夫大学团队开发新方法,给LLM推理任务装进度条,控制推理深度和速度。提出“思维进度向量”TPV预测推理位置,干预TPV可“超频”“降频”,模型已在GitHub开源。
谢赛宁团队新基准让LLM集体自闭,DeepSeek R1、Gemini 2.5 Pro都是零分
纽约大学等8家机构研究者提出LiveCodeBench Pro竞技编程基准测试,评估了Gemini 2.5 Pro等前沿大模型。发现当前模型有显著不足,在无外部工具时,高难度题通过率为0,LLM与人类大师级水平差距明显。
MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。
MiniMax深夜开源首个推理模型M1,其上下文能力媲美Gemini 2.5 Pro。M1在部分评测中表现中规中矩,但在MRCR(4 - needle)测试中屠榜。它得益于MiniMax - 01基座模型,应用Lightning Attention机制,开源了40K和80K两个版本。
Mamba 架构实现推理性能超 Gemma3-27B!推理模型开始迈入「无注意力」时代
PromptCoT - Mamba是首个具解码显存常量等特性且推理能力强的模型。当前推理大模型中注意力机制有局限,PromptCoT - Mamba实现无注意力推理,在多评测集超Transformer等模型,为无注意力推理生态奠基。
TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的
该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。
能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent
LlamaFactory作者郑耀威团队开源的PenguinHarness,是全球首个支持多Agent自进化的Harness,能自动构建、评测和改进Agent。它成本低、速度快,适配众多模型,还有严格契约保障安全。已在生产场景应用,效果显著。
龙虾安全被3层硬核架构焊死了!一份面向开发者的硬核生存指南
随着OpenClaw等高权限智能体应用爆发,AI自主性与失控的赛博博弈开启。文章从源头对齐、边界重构、结果保障三个维度,拆解适应智能体自主行动时代的新型安全框架,为开发者提供生存指南。
谷歌新论文把内存股价干崩了!KV cache压缩6倍,“谷歌的DeepSeek时刻”
谷歌研究院推出TurboQuant压缩算法,可将AI推理中最吃内存的KV cache压缩至少6倍且精度零损失,还能8倍加速计算。虽引发存储芯片巨头股价下跌,但目前只是实验室成果,仅解决推理阶段内存问题。