「Deepseek-R1-Distill-Qwen-14B」共找到 993 篇相关文章
DeepSeek比你更懂反思!谷歌重磅发现,智能的本质竟是一场社会化对话
谷歌等机构研究发现,像DeepSeek - R1等推理模型思考复杂问题时,内部模拟多角色辩论赛,形成思维社会机制,让AI准确率提升,证明智能本质或是内化社会互动,还为调优AI提供新方法。
Deepseek V4 Pro深夜上线,性能追平Fable 5,但价格只有它的2%
2026年8月12日,DeepSeek V4 Pro正式版上线。它是混合专家模型,规模居世界第一梯队。价格比Claude Fable 5便宜超98%,成本优势明显。其架构节省成本,API开放多模式,产品结构清晰。
一夜之间,DeepSeek V4 Pro和Grok 4.6把全球大模型推入了新的斩杀线。
DeepSeek V4 Pro和Grok 4.6在两小时内发布,逼近Claude Fable 5体验。作者分享常用AI组合,分析两模型优缺点,指出它们撕开大模型不可能三角,形成新斩杀线,让夹在中间的模型难受。
爆冷!字节Seed 在CCPC 决赛只做出一道签到题,而DeepSeek R1 直接挂零?
第十届 CCPC 举行,字节 Seed 携 Seed - Thinking 参赛,结果意外,仅做出一题,DeepSeek R1 挂零。不同模型架构表现差异不大,暴露出大模型做算法题短板,推理模式表现更好。
清库存!DeepSeek突然补全R1技术报告,训练路径首次详细公开
DeepSeek给近一年前登上《Nature》封面的R1论文补64页技术细节,正文大幅翻修。新论文展开R1完整训练路径,补充R1 - Zero分析,还披露安全评估细节。此外团队稳定,引发对其后续动作猜测。
DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!
4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。
这一夜,中国AI彻底翻身了:DeepSeek R1让全世界刮目相看 | 深度评测
作者深度测试新DeepSeek R1,发现其代码生成能力超Claude 3.7,虽编程全面性有不足,但已处Claude 3.7与Claude 4之间。前端设计审美达Claude 4水准,部分方面略胜,有自主学习推理能力,或改变中国AI历史。
核心模型被曝蒸馏DeepSeek?前女友一纸控诉,曝出欧版OpenAI塌房真相!
曾被誉为「欧洲OpenAI」的Mistral AI陷入「抄袭」丑闻。前员工在分手小作文爆料其核心技术蒸馏DeepSeek,却误导外界为自主RL成果。此前也有博主发现二者特征相似。蒸馏本身没错,缺乏透明度才是关键问题。
1.9K Star!给 DeepSeek Harness 装上侧边工作台,文件、终端、Git、浏览器、插件一屏搞定!
DeepSeek Harness 是 AI Agent 运行框架,自由度高但默认 Web UI 操作不便。社区插件 DSH - better - sidebar 迅速出圈,装了侧边工作台,整合多样工具,更新勤,适合折腾 DSH 的人。
AI圈“集体开大”!DeepSeek、Claude带头,智谱、阿里、蚂蚁、智源都“卷”起来了
双节前最后一天,AI圈“卷”疯了!智谱发布并开源GLM - 4.6,是国内最强Coding模型;阿里介绍视、听、说全模态同传大模型Qwen3 - LiveTranslate - Flash;蚂蚁开源万亿参数推理大模型Ring - 1T - preview;智源开源跨本体基座大模型RoboBrain - X0。