DeepSeek-R1-Distill-Qwen-1.5B」共找到 2447 篇相关文章

新闻资讯7

DeepSeek正开发高级AI Agent模型,硬刚OpenAI

彭博消息,DeepSeek正开发高级AI Agent模型与OpenAI竞争。此模型能在极少指令下执行多步任务并自我优化,计划Q4推出。此前该司模型表现佳,技术已在多领域落地,但构建AI Agent仍有挑战。

AIGC开放社区
产品应用8

阿里又上好货了!Qwen3-TTS能力大幅提升

阿里刚发布Qwen3-TTS(2025-11-27版),解决语音合成核心问题。它音色大幅扩展,有49种高品质音色;语言和方言能力提升,支持10种主流语言与多种方言;韵律和语速优化,拟人化近真人;API调用简单。

AI工程化
7

被曝蒸馏DeepSeek还造假!欧版OpenAI塌房了

被誉为欧洲版OpenAI的Mistral被离职员工爆料多项黑幕,其最新模型疑似直接蒸馏自DeepSeek,却包装成RL成功案例,歪曲基准测试结果。此前就有人发现其模型与DeepSeek相似,目前官方暂无回应。

量子位
开源动态7

开源 DeepSeek Harness 开箱即用客户端,还有几个易用插件

DeepSeek 发布了 DeepSeek Harness,坚持‘一切皆插件’理念。不过它使用门槛偏高,作者做了 Pilot Harness,优化 UI 与交互,添加侧边栏和文件树、服务商配置插件,还支持多系统。

歸藏的AI工具箱
产品应用8

DeepSeek-V4发布!高效百万上下文智能普惠时代来了

DeepSeek-V4发布,是开源社区关键分水岭。它解决超长文本处理效率痛点,架构与优化有多项突破,降低算力消耗和成本,适配国产芯片,性能比肩顶级闭源模型,推动开源社区两大未来趋势。

AIGC开放社区
算法论文7

Adaptive Reasoning Model:Qwen3混合思考->字节AdaCoT->清华AdaThinking

文章介绍三种处理混合思考模式的方法,阿里 Qwen3 通过 SFT 让模型具备思考能力,但需人为控制;字节 AdaCoT 和清华 AdaThinking 让模型自主决定是否思考,分别用多目标优化和受限优化目标训练。

深度学习自然语言处理
新闻资讯7

老外傻眼!明用英文提问,DeepSeek依然坚持中文思考

DeepSeek-V3.2和DeepSeek-V3.2-Speciale推理能力显著提升,海外研究者用英文提问,它却用中文思考。评论有两种观点,相关论文显示中文省token但非最有效,大模型选思考语言并非只看效率。

机器之心
算法论文8

2026!开年关键词:Self-Distillation,大模型真正走向「持续学习」

2026 年刚开始,大模型领域研究者达成默契,arXiv 论文高频出现 Self-Distillation。传统强教师依赖范式难适配模型持续进化,Self-Distillation 成破局点。MIT 等机构发布三项研究成果,均用信息差实现模型自驱动升级。

AINLPer
算法论文8

刚刚,DeepSeek陈德里与两个AI,合写了一篇论文

DeepSeek研究员陈德里与DeepSeek-V4-Pro、GPT - Image2合写论文《From Copilots to Colleagues: A Survey of Autonomous Research Agents》。文章是兴趣驱动的尝试,分析自主科研智能体,提出自主等级分类、架构模式分析及未解难题。

机器之心
新闻资讯7

知情人士:DeepSeek正在组建Harness团队,对标Claude Code|甲子光年

据知情人士,DeepSeek正组建Harness团队,对标Claude Code,开放产品经理和研发工程师岗位。其强调Harness,是要让产品成模型进化一部分;补Code Harness,是因竞争转向工作流入口。

甲子光年