非Transformer架构」共找到 2517 篇相关文章

推荐文章7

我扒开Clawdbot的底层架构,简单到离谱,你看完就能自己写。

近期Clawdbot让科技圈震惊,作者花一下午分析其架构和源码后发现,它简单到看完文章就能自己写。它是电脑进程,消息处理分六步,记忆靠写文件,操作电脑有三类工具,无黑科技。

探索AGI
推荐文章7

秋分|皮影裁秋色

秋分时节,皮影戏这一古老民间娱乐活动光影交错、魅力独特,2011年被列入遗名录。艺术家邬建安将皮影等传统技艺融入创作。2025年798节气海报以节气和遗工艺为主题进行AI创作。

798艺术区
产品应用8

AI 时代,实时入湖正在告别 ETL:从 Kafka 到 Iceberg 的架构减法

在AI驱动的数据应用场景中,Kafka、Iceberg开放表格式与对象存储组合成流数据入湖重要方向。传统ETL方式有链路长等问题,文章围绕“零ETL”讨论架构减法,介绍Kafka × Table Bucket方案及优势、适用场景。

阿里云开发者
推荐文章7

别再构建多智能体了

Multi Agent应用有望成大模型应用范式,但Cognition AI团队认为2025年追求多智能体并行协作架构是歧途,存在信息孤岛和决策冲突问题。主张采用单线程线性架构与上下文工程。

AI工程化
新闻资讯7

拾象 AGI 观察:LLM 路线分化,AI 产品的技术壁垒,Agent“保鲜窗口期”

这是「海外独角兽」的AI领域观察栏目访谈,拾象CEO李广密和财经作者张小珺梳理LLM领域信号。2025 Q2全球大模型爆发性强且分化,还提到AI Labs路线、产品壁垒、“保鲜窗口”及Agent体验等内容。

海外独角兽
算法论文8

超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26

大语言模型处理长文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。

新智元
开源动态7

本文关注vllm V1中管控模型分布式推理的Executor部分,介绍其类型、Executor-Workers架构及数据传输机制,对比V0架构优势,以单机多卡的MultiprocExecutor为例展开讲解,还提及不同数据量的传输方式及相关代码。

猛猿
新闻资讯7

Claude强到不敢发的Mythos,被质疑用了字节Seed技术

Claude最强“神话”模型Mythos引发猜测,或用了字节Seed技术。社区热议其是否采用循环语言模型架构,关键线索来自Anthropic测试数据,在图搜索测试中Mythos优势明显,还有其他线索指向循环架构

量子位
算法论文8

数据邪修大法好:仅用文本数据就能预训练多模态大模型

多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系必需,利用配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。

量子位
算法论文8

论文发表 || 如何基于累积过程变换学习弱线性振动方程(EvLOWN)

2026年3月6日,赵林等教授团队在《Advanced Science》发表论文。提出EvLOWN数据驱动理论,利用平均法重构推断方程目标,扩展微小效应可推断性边界,在多领域应用效果好,但有未考虑SDE等局限。

力学与人工智能