Transformer层」共找到 535 篇相关文章

开源动态8

DeepSeek深夜炸场,开源了一个新项目&论文,V4打前站?

凌晨,DeepSeek开源新项目Engram并公开论文。Engram用可扩展的O(1) N - gram记忆替Transformer早期节省算力,在多方面实验表现出色,如推理任务增幅大于知识任务,还分析了其机理和系统效率。

PaperAgent
新闻资讯7

告别传统存算分离,AI时代数据底座迎来全新底逻辑

文章围绕AI时代数据底座变革展开。指出传统大数据平台难适配AI,存在数据够不着、模型用不好等问题。阐述AI时代基础设施变化,如数据形态、计算模式等。还探讨底座升级条件、存储挑战、算子价值及未来标准等内容。

AI前线
新闻资讯7

比起让大模型写 100 万字的小说,AI 大牛们更想用 AI 拿诺贝尔奖

OpenAI前CPO Kevin Weil创业,新公司定位是“为AI模型收集科学数据”的平台,估值达7.5亿美元。AI4S赛道成为硅谷离职AI高管热门去向,正从概念叙事进入基础设施建设阶段,包括数据、模型、应用

AI科技评论
产品应用7

我用 GLM-5.2 读 148 万字资料:一天读懂一个知识

作者用 GLM-5.2 处理 148 万字 Transformer 资料,它生成可打开的 HTML 阅读页,将内容排成理解路线。GLM-5.2 在评测榜单中进入第一梯队,主打 1M 上下文,还分享了使用该模型处理资料的具体做法。

AI产品自由
算法论文7

【DeepSeek-OCR系列第一篇】Language Modelling with Pixels【ICLR23】

当前主流语言模型依赖固定词表,扩展到多语言、多脚本时面临覆盖受限、计算昂贵、鲁棒性差等问题。ICLR 2023论文提出不依赖词表的PIXEL模型,通过将文本变成图像用视觉Transformer理解,实验验证其有跨语言、抗噪声等优势。

机器学习AI算法工程
推荐文章8

实战案例|当本体遇上 Agent:让 AI 真正“听懂业务”并“按规矩办事”【上】

本文是“企业级本体应用”系列第三篇,探讨本体如何融入企业智能体系统。指出本体非数据库或图谱,是语义。介绍本体在Agent系统的架构与职责,通过案例展示用本体做规则判断和多维归类,凸显其优势。

AI大模型应用实践
开源动态8

腾讯开源Cube Sandbox:60毫秒冷启动的AI沙盒运行时

Harness设计中沙箱是重点难点,传统方案在安全与性能间妥协。腾讯开源Cube Sandbox,用RustVMM重构虚拟化,冷启动60毫秒,单实例5MB内存开销,有真内核隔离等优势,开源版本含网络隔离组件。

AI工程化
新闻资讯8

Karpathy、Claude Code之父Boris,最新访谈,把整个程序员圈炸了!

假期红衫AI Ascent 2026上,Claude Code之父Boris与Karpathy演讲引发关注。Boris称编程执行已解决,他用Claude App工作,全公司代码由模型生成;Karpathy提出Software 3.0概念,还谈到模型能力不均匀。两人还对面试、创业等给出看法。

探索AGI
产品应用7

求稳的安全IP,安谋科技如何守正出奇?|甲子光年

12月24日,安谋科技推出新一代SPU IP——“山海” S30FP/S30P,给出面向高性能计算芯片的全栈安全解决方案。该方案从硬件IP、软件中间件到云端服务构建一栈式安全防护体系,有五大核心亮点。

甲子光年
新闻资讯8

蚂蚁首次投向机器人“指尖”!数亿元押注,全球首个物理交互脑发布

8月11日,戴盟机器人完成数亿元战略轮融资,由蚂蚁集团领投。蚂蚁此前已在具身智能赛道多处布局,此次是首次延伸至触觉感知。戴盟推出全球首个“物理交互脑”,有稀缺团队支撑,多方面获产业支持且多项指标全球领先。

量子位