「DeepSeek-R1-Distill-Qwen-1.5B」共找到 2447 篇相关文章
图解Vllm V1系列6:KVCacheManager与PrefixCaching
文章聚焦vllm v1,阐述调度器取请求时判断设备有无充足空间做推理的问题,涉及KVCacheManager与Prefix Caching。前者管理请求和块,后者通过找最长一致前缀节省显存,还介绍块分配释放策略与流程。
刚刚,DeepSeek Harness震撼开源:一切皆插件
今天凌晨,DeepSeek Harness(开发者预览版)开源。它是构建智能体的SDK与框架,设计理念为“一切皆插件”,代码量大且模块化,通过配置文件组装不同智能体,还具备多方面创新设计和安全策略。
万字长文图解Qwen2.5-VL实现细节
文章作者今年年初写好,为防盗版一直内部分享,时隔半年因Qwen2.5-VL已渗入MLLM开发各场景而公开。从源码抽图例助理解,涵盖window attention等内容,排版全文见指定链接。
H-1B正在筛掉「下一个英伟达」?
美国政府公布H-1B签证新规,将新申请费用提至10万美元,还提高工资门槛。英伟达CEO黄仁勋支持但担忧,认为费用或抑制初创企业、削弱美对人才吸引力,也有教授反对新规。
豆包 2.1 Pro:属于普通人的代码能力
作者分享用AI写代码的经历,指出豆包2.1 Pro强化Coding Agent端到端交付能力,成本低。还展示用它做的多个案例,如歇后语扭蛋机、文件整理工具等,认为其能解决日常问题,降低Coding门槛。
这一年,DeepSeek消耗14万亿Token,编程仅占1/10,超一半用于角色扮演?
a16z和OpenRouter基于100万亿token研究揭示LLM使用情况:开源模型占三成市场,编程任务成刚需,角色扮演是金矿。还提到‘玻璃鞋效应’影响用户留存,市场分层为‘高端闭源+性价比开源’双轨制。
AI终于学会「读懂人心」,带飞DeepSeek R1,OpenAI o3等模型
威斯康星大学麦迪逊分校联合清华的研究《MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems》,将元认知理论融入LLM架构,使模型在心智理论测试达人类平均水平,揭示构建社交智能AI方法论。
AI终于学会「读懂人心」,带飞DeepSeek R1,OpenAI o3等模型
威斯康星大学麦迪逊分校联合清华大学的研究《MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems》,将元认知理论融入LLM架构,让AI“读懂人心”。其框架分三阶段,还有动态社交记忆,在多基准测试表现出色。
Mistral 3开源,一举超越DeepSeek与K2?
近期,Mistral AI开源Mistral 3,含三款小型稠密模型及Mistral Large 3。Benchmark对比中,它领先国内DeepSeek - 3.1、Kimi - K2。Mistral Large 3是强开源权重模型,Ministral 3适合边缘端,成本性能比低。
深度体验DeepSeek Harness,我原谅它涨价了
本文深度体验了DeepSeek Harness,它已发布并开源代码。其一切如模型、工具等皆为可插拔积木,官方内置超百个插件。介绍了安装方法、使用特点,还对比了与Codex差异,认为它是Agent时代的安卓,有望推动自进化。