「DeepSeek 1.5B」共找到 4011 篇相关文章
1.9K Star!给 DeepSeek Harness 装上侧边工作台,文件、终端、Git、浏览器、插件一屏搞定!
DeepSeek Harness 是 AI Agent 运行框架,自由度高但默认 Web UI 操作不便。社区插件 DSH - better - sidebar 迅速出圈,装了侧边工作台,整合多样工具,更新勤,适合折腾 DSH 的人。
刚刚,DeepSeek梁文锋入选Nature年度十大人物!被称为「科技颠覆者」
《自然》评出2025年度十大科学人物,DeepSeek梁文锋入选,被称为「科技颠覆者」。他的公司发布的R1模型功能强大、价格低廉,训练成本低,还开放权重,为研究者提供经验,其成果已融入国人生活。
小钢炮开源,一张3090两小时「从零训练0.1B全模态模型」,模型训练彻底平民化
MiniMind - O是开源超轻量级端到端全模态大模型,采用双轨架构。仅需一张RTX 3090,2小时就能从零训练全链路。有两套训练数据,具备零样本声音克隆等特点,实现大模型训练平民化。
最具争议的 1 人 AI 公司融了 3000 万美金,估值达到了 2.5 亿
1人AI公司Polsia引发大量质疑,有人认为它是“垃圾产品”,指出其ARR统计、客户流失率等问题。但它刚完成3000万美金融资,估值达2.5亿美金,网站月流量超100万。
比 Context7 更靠谱:Exa-code 靠 1B+ GitHub 与 Stack Overflow 减少幻觉
Exa团队索引超1B+文档、GitHub仓库等内容,exa - code对其混合搜索、分块处理。它是首个为编码代理制作的Web规模上下文工具,在代码幻觉评估中表现超流行网页搜索工具,核心技术有专为AI的搜索引擎和高效返回上下文。
“你以为买的是 DeepSeek Flash,到手可能是 1.5 bit 缩水版”:Pi 核心贡献者谈 AI Token 黑箱
Pi 核心贡献者 Armin Ronacher 与 Modem 联合创始人 Ben Vinegar 播客对谈指出,当前 AI token 市场不透明,模型公司或失控。如买 token 像买成分不明商品,模型训练目标不明,且 Agent 行为边界在扩展,问责制缺失。
阿里云通义点金发布DianJin-R1金融领域推理大模型,32B模型荣膺榜首
阿里云通义点金团队与苏州大学合作推出DianJin-R1金融领域推理大模型,介绍其开源数据集与模型、基于通义点金平台的数据合成,展示了其在性能测试中的优异表现,推动金融科技智能化进程。
马斯克点火全球最大超算,首个1GW狂飙奇点!6万亿Grok 5在训
马斯克官宣全球首个吉瓦级超算Colossus 2上线,狂堆55万块GPU,目标百万。下一代Grok 5已在训练,6万亿参数将引爆智能奇点。同时,全球AI巨头掀起算力军备赛,但美国面临电力短缺难题。
AI“压力面”,DeepSeek性能暴跌近30% | 清华&上海AI Lab
上海人工智能实验室等团队设计REST框架,在一个prompt里抛多问题模拟复杂推理场景。结果显示,DeepSeek - R1等模型高压下性能大幅缩水,REST能拉开不同模型差距,还揭示评测方法局限。
这张信息图,居然是8B开源模型做的??
商汤新开源的 8B 多模态模型 SenseNova U1,架构独特,图像评测表现好,信息图生成能力强、延迟低。它具备图文交错能力,适合自媒体、敏感行业等,有在线体验和开源代码入口。