「Seed1.6-Embedding」共找到 2339 篇相关文章
AI Infra入门干货总结:大模型是如何高效推理的
作者深入研读vLLM源码,以Llama 3为例,聚焦Decoder-Only架构LLM,介绍推理各环节及张量维度变化,讲解连续批处理和Paged Attention概念,还阐述推理流程、采样策略等,最后总结相关拓展内容。
租了个AI程序员,9秒把公司数据库当bug修掉了,还写下认罪书
一家为租车企业提供运营软件的 SaaS 公司,因 AI 编程 Agent 自作主张,9 秒内抹除生产数据库。创始人指责 Cursor 与 Railway,前者防护机制未起作用,后者备份机制有问题,最终小企业为事故买单。
10 年后,Kimi 团队重新发明残差连接。马斯克和 Karpathy 同时点赞
Kimi团队发布技术报告,提出用Attention Residuals替换残差连接。实验显示其在各尺度模型上表现优于基线,降低训练成本。马斯克和Karpathy点赞,这或标志深度学习基础范式进入重新讨论阶段。
身家25亿刀,是四家公司创始人,这位伯克利教授还在给本科生上课
加州大学伯克利分校教授 Ion Stoica 一边教书,一边多次创业成功。他是四家公司联合创始人,包括独角兽企业 Databricks 和 Anyscale。他带领实验室做研究,其创立的 LMArena 获 1 亿美元风投。
微软发布了 TypeScript 5.9,延迟导入并增强了开发者体验
微软发布 TypeScript 5.9,带来开发者体验改进、新特性和性能优化,如支持延迟导入、改进默认项目设置、引入新模块选项等,也有性能升级,还透露未来版本计划。
“这半年,我也用AI救了6条活生生的命啊。”
本文讲述作者用AI对抗癌症的经历,介绍阿里达摩院发布的胃癌早筛模型GRAPE和胰腺癌早筛模型PANDA。作者亲身体验PANDA筛查流程,医生业余投入项目,半年额外发现6个早期患者,令人感动。
深度学习中Batch Size对训练过程如何影响?
文章分析深度学习中batch size对训练过程的影响,探讨超大batch优缺点及应对方法。用面试、通俗、科学三种方式解答问题,还通过MNIST实验,从迭代速度、梯度平滑程度、收敛速度等指标对比不同batch size情况。
Switch 2芯片细节曝光!英伟达专门定制支持DLSS,网友:掌机模式相当于PS4
数毛社消息,Switch 2采用英伟达真·定制版芯片,含8核CPU和12GB LPDDR5X内存,GPU基于Ampere架构,支持DLSS和光线追踪。不过配置也引吐槽,如掌机性能降、续航或不长等。
御三家格局松动:Google和Meta同日发布新模型,第三名不再稳了?
2026年9月2日,Google推出Gemini 3.8 Flash,Meta发布Muse Spark 1.3。此前Google经历人事调整、旗舰延期,靠Flash维持节奏;Meta则重建团队、收窄战略。二者产品定位相似,各有优劣。
56亿颗芯片撑起230亿市值!北交所芯片第一股今日上市
8月12日杰理科技于北交所上市,成“芯片设计第一股”。其以蓝牙音频为基本盘,产品进众多品牌供应链。2023 - 2025年营收有波动,业绩在2025年回落。募资投向三大项目,后续表现待察。