Kimi-Dev」共找到 199 篇相关文章

开源动态8

2张4090竟能本地微调万亿参数Kimi K2!趋境联合清华北航把算力门槛击穿了

仅需2 - 4张消费级显卡(4090),就能在本地对DeepSeek 671B乃至Kimi K2 1TB这样的超大模型进行微调。这得益于KTransformers和LLaMA - Factory两个国产明星项目联动,大幅降低成本,开启AI个性化定制时代。

量子位
新闻资讯7

硅谷大佬带头弃用 OpenAI、“倒戈”Kimi K2!直呼“太便宜了”,白宫首位 AI 主管也劝不住

硅谷正从昂贵闭源模型转向便宜开源替代方案。“SPAC 之王”Chamath Palihapitiya 团队将大量工作负载迁移至 Groq 平台的中国模型 Kimi K2,因其性能优且成本低。节目中还探讨中美开源模型现状等。

InfoQ
新闻资讯7

硅谷大佬带头弃用 OpenAI、“倒戈”Kimi K2!直呼“太便宜了”,白宫首位 AI 主管也劝不住

硅谷似乎正从昂贵闭源模型转向便宜开源替代方案。“SPAC 之王”Chamath Palihapitiya 团队将大量工作负载迁移至 Groq 平台的中国模型 Kimi K2,因其性能优且价格低。节目还探讨了中国开源 AI 模型给美国带来的压力。

AI前线
开源动态7

Kimi K2发布两天即“封神”?80%成本优势追平Claude 4、打趴“全球最强AI”,架构与DeepSeek相似!

国内独角兽月之暗面发布开源模型 Kimi K2,推出两天就在 OpenRouter 超越 xAI 的 Grok 4。它成本优势大,能力泛化和实用性强,编码、Agent 工具调用等方面表现出色,架构与 DeepSeek 相似。

AI前线
开源动态7

Kimi团队深夜潜入Reddit开了场AMA,他们都聊了些什么?(据说代号4494就是杨植麟本人)

今日凌晨,Kimi团队在Reddit社区开展AMA交流,解答大家疑问。期间回应Claude蒸馏争议,探讨编程写作侧重、小参数模型需求、缩放定律等问题。K2.5表现出色,K3值得期待。

开源AI项目落地
开源动态8

Kimi K2发布两天即“封神”?80%成本优势追平Claude 4、打趴“全球最强AI”,架构与DeepSeek相似!

国内独角兽月之暗面发布并开源 Kimi K2 模型,推出两天就在 OpenRouter 平台 token 使用量超 xAI 的 Grok 4。它成本低、性能强,编码能力追平 Claude 4,架构与 DeepSeek 相似,技术研究也多次‘撞车’。

InfoQ
开源动态7

Claude时代终结?LMArena实测DeepSeek R1编程得分超Opus 4,但月暗称其新模型更胜一筹

在闭源模型主导的AI环境下,开源的DeepSeek - R1(0528)在LMArena测试中表现亮眼,编程得分超Claude Opus 4,引发社区关注与讨论。不过LMArena曾被指责偏袒,其联合创始人反驳。此外,月之暗面新模型Kimi - Dev - 72B编程成绩超R1。

AI前线
推荐文章7

8种LLM架构设计大比拼:从 DeepSeek-V3 到 Kimi K2,究竟有啥不同

文章对比了8种LLM架构设计,如DeepSeek-V3、OLMo 2等。介绍各模型关键技术,像DeepSeek-V3的多头潜在注意力和混合专家架构,还分析不同设计对性能、效率的影响,助读者了解LLM架构差异。

CourseAI
新闻资讯7

吴恩达来信:AI Dev 26即将举办!

吴恩达来信称 4 月 28 - 29 日将在旧金山举办 AI Developer Conference,主题为‘软件工程的未来’。他认为 AI‘就业末日’没那么严重,软件工程岗位在增长,还指出编程变化及行业待解问题。

DeeplearningAI
开源动态7

Kimi K2基于DeepSeek V3构建

从Hugging Face模型配置文件可知,月之暗面未设计全新模型结构,而是选Deepseek V3作基座模型,用自身高质量数据、独特方法做大量‘微调’和‘后训练’。

AI寒武纪