「Transformer层」共找到 535 篇相关文章
DeepSeek深夜炸场,开源了一个新项目&论文,V4打前站?
凌晨,DeepSeek开源新项目Engram并公开论文。Engram用可扩展的O(1) N - gram记忆替Transformer早期层节省算力,在多方面实验表现出色,如推理任务增幅大于知识任务,还分析了其机理和系统效率。
告别传统存算分离,AI时代数据底座迎来全新底层逻辑
文章围绕AI时代数据底座变革展开。指出传统大数据平台难适配AI,存在数据够不着、模型用不好等问题。阐述AI时代基础设施变化,如数据形态、计算模式等。还探讨底座升级条件、存储挑战、算子价值及未来标准层等内容。
比起让大模型写 100 万字的小说,AI 大牛们更想用 AI 拿诺贝尔奖
OpenAI前CPO Kevin Weil创业,新公司定位是“为AI模型收集科学数据”的平台,估值达7.5亿美元。AI4S赛道成为硅谷离职AI高管热门去向,正从概念叙事进入基础设施建设阶段,包括数据、模型、应用层。
我用 GLM-5.2 读 148 万字资料:一天读懂一个知识
作者用 GLM-5.2 处理 148 万字 Transformer 资料,它生成可打开的 HTML 阅读页,将内容排成理解路线。GLM-5.2 在评测榜单中进入第一梯队,主打 1M 上下文,还分享了使用该模型处理资料的具体做法。
【DeepSeek-OCR系列第一篇】Language Modelling with Pixels【ICLR23】
当前主流语言模型依赖固定词表,扩展到多语言、多脚本时面临覆盖受限、计算昂贵、鲁棒性差等问题。ICLR 2023论文提出不依赖词表的PIXEL模型,通过将文本变成图像用视觉Transformer理解,实验验证其有跨语言、抗噪声等优势。
实战案例|当本体遇上 Agent:让 AI 真正“听懂业务”并“按规矩办事”【上】
本文是“企业级本体应用”系列第三篇,探讨本体如何融入企业智能体系统。指出本体非数据库或图谱,是语义层。介绍本体在Agent系统的架构与职责,通过案例展示用本体做规则判断和多维归类,凸显其优势。
腾讯开源Cube Sandbox:60毫秒冷启动的AI沙盒运行时
Harness设计中沙箱是重点难点,传统方案在安全与性能间妥协。腾讯开源Cube Sandbox,用RustVMM重构虚拟化层,冷启动60毫秒,单实例5MB内存开销,有真内核隔离等优势,开源版本含网络隔离组件。
Karpathy、Claude Code之父Boris,最新访谈,把整个程序员圈炸了!
假期红衫AI Ascent 2026上,Claude Code之父Boris与Karpathy演讲引发关注。Boris称编程执行层已解决,他用Claude App工作,全公司代码由模型生成;Karpathy提出Software 3.0概念,还谈到模型能力不均匀。两人还对面试、创业等给出看法。
求稳的安全IP,安谋科技如何守正出奇?|甲子光年
12月24日,安谋科技推出新一代SPU IP——“山海” S30FP/S30P,给出面向高性能计算芯片的全栈安全解决方案。该方案从硬件IP层、软件中间件到云端服务构建一栈式安全防护体系,有五大核心亮点。
蚂蚁首次投向机器人“指尖”!数亿元押注,全球首个物理交互脑发布
8月11日,戴盟机器人完成数亿元战略轮融资,由蚂蚁集团领投。蚂蚁此前已在具身智能赛道多处布局,此次是首次延伸至触觉感知层。戴盟推出全球首个“物理交互脑”,有稀缺团队支撑,多方面获产业支持且多项指标全球领先。