「Iceberg V3」共找到 2361 篇相关文章
R1一周年,DeepSeek Model 1悄然现身
2025年1月20日,DeepSeek发布DeepSeek - R1开启新开源LLM时代,其在Hugging Face获赞最多。一年后,DeepSeek新模型Model1在GitHub现身,经Gemini分析或为DeepSeek - V4,还给出相关技术细节。
AI三国杀!OpenAI狂卷,DeepSeek封神,却被Mistral偷了家?
中美忙着堆算力打AI战,欧洲Mistral杀出,推出Large 3和Ministral 3,全开源、多模态、能落地。Large 3规格高,Ministral 3小而强,可跑在多设备上。Mistral还想成平台,挑战巨头。
摩尔线程算法一鸣惊人,图形学顶会夺银!已开源
12月17日,在SIGGRAPH Asia 2025上,摩尔线程凭借自研技术LiteGS在3DGS重建挑战赛中获银奖。3DGS是革命性3D场景表示与渲染技术,摩尔线程开源3DGS基础库LiteGS,实现全链路协同优化。
就问 OpenClaw 还能不能更新了,我的微信 ClawBot 咋办?
OpenClaw升级到V2026.3.22后,IM通道插件崩溃,用户无法通过微信等使用。开发者称是为抵御攻击,但规则太严。2026.3.23修复部分问题,后续提供更新步骤,还介绍应用场景。
国产大模型持续开源的一周:DeepSeek、Qwen、字节、书生~
国产开源大模型持续发力,本周DeepSeek V3.1、字节Seed-OSS-36B等接连发布。此外,马斯克xAI正式开源Grok 2.5,英伟达也开源了Nemotron-Nano-9B-v2。PaperAgent专题进行了梳理盘点。
如何重现 DeepSeek 推理性能突破
DeepSeek-V3 是热门开源大模型,采用大规模 MoE 架构,优化推理性能是工程难点。阿里团队在 RTP - LLM 完成优化,对齐其推理系统性能,分享关键技术、不足与思考,还提及对 Qwen3 模型的优化策略。
从一行代码发现DeepSeek的秘密:Model1到底是什么?
在DeepSeek - R1发布一周年时,有人在GitHub的FlashMLA代码仓库发现神秘代号Model1,可能是V4。文章分析了代码仓库用途、新模型“露馅”原因,还从代码中发现Model1细节,结合论文梳理时间线,最后也提出了怀疑。
DeepSeek,Qwen,Grok组团发布,社区一手实测
LLM大爆发,一天内推出Grok 4.6、Qwen3.8 - Max、DeepSeek - V4 - Pro - 0813三款前沿产品。社区对它们进行多场景测试,如3D场景、Flappy游戏、飞机滑行动画等,并对比了不同模型的性能、价格和输出质量。
上新:Cache-DIT 支持LTX-2模型
作者和DefTruth在Cache-DIT上支持了LTX-2模型,记录适配关键点,包括模型侧、框架侧适配。介绍LTX-2特点,如支持T2V/I2V、输出带音频,还说明Cache-DIT加载区分T2V/I2V方法及cache侧修改内容,最后给出使用示例。
谷歌开放世界模型一夜刷屏,AI游戏门槛归零时刻来了?
谷歌DeepMind开放世界模型Genie 3的实验性研究原型「Project Genie」,由Genie 3、Nano Banana Pro和Gemini提供技术支撑,有世界草绘、探索、重混三大玩法,但Genie 3仍处早期需改进。