后Transformer架构」共找到 3678 篇相关文章

新闻资讯7

在今天,投管理的战略价值与退出路径规划在何处 | 甲子引力

在「甲子光年」2025甲子引力年终盛典上,澳银资本胡艳等多位投资界人士,结合案例探讨投管理战略价值与退出路径规划。大家分享投增值案例、应对挑战方法,还讨论了衡量投价值及退出规划等问题。

甲子光年
产品应用7

当模型成为公共基础设施,特赞如何架构企业级 Agentic AI?

当大模型成公共基础设施,企业需构建围绕业务结构的智能系统架构。特赞提出的 GEA 企业级智能体架构体系,围绕企业业务运行结构设计,能让智能体参与企业经营判断。

AI科技评论
算法论文8

MetaAI解锁Transformer潜意识,仅额外3%计算开销,性能提升最高55%

Meta FAIR研究员François Fleuret提出《The Free Transformer》,对解码器Transformer扩展。它通过引入随机变量,让模型先计划执行,用约3%计算开销,在编程等任务上性能提升最高达55%。

AIGC开放社区
开源动态7

Mythos架构被22岁小伙“逆推”开源了!MoE和注意力借鉴DeepSeek

22岁小伙Kye Gomez将Claude Mythos架构整合开源成OpenMythos,实现带MoE路由的循环深度Transformer(RDT)。该架构仅用一半参数,就能获与传统模型同等效果,吸引学界关注。

量子位
新闻资讯8

Transformer到GPT-5,听听OpenAI科学家 Lukasz 的“大模型第一性思考”

2017年《Attention Is All You Need》提出Transformer架构,重塑AI版图。其作者“Transformer八子”中,Lukasz Kaiser加入OpenAI,参与GPT-4、GPT-5等研发。他10月将出席大会分享见解,曾预言多模态等趋势已渐成现实。

AI科技大本营
开源动态8

Kimi开源新线性注意力架构,首次超越全注意力模型,推理速度暴涨6倍

月之暗面发布开源Kimi Linear架构,用新注意力机制首次超越全注意力模型。长上下文任务中,它减少75%的KV缓存需求,推理加速达6倍。核心创新Kimi Delta Attention有细粒度遗忘门控等特点。

量子位
推荐文章7

规范驱动开发:让架构变得可执行

文章介绍规范驱动开发(SDD),它是软件架构重大转变,以可执行规范为核心,构建五层执行模型,反转传统架构关系,强调漂移检测,明确人机分工,具备五项核心能力,但采用时也面临多种权衡。

InfoQ
开源动态8

Ilya刚预言完,世界首个原生多模态架构NEO就来了:视觉和语言彻底被焊死

当Ilya断言大模型未来在于架构创新时,中国团队推出全球首个可大规模落地的开源原生多模态架构NEO。它颠覆传统拼接模式,从根上融合视觉与语言,以简洁架构证明架构聪明才是下一代AI竞争力。

量子位
推荐文章8

2025 年最全面的 LLM 架构技术解析【长文】

Sebastian Raschka更新「大型LLM架构对比」长文,解析2025年LLM架构发展。介绍了如DeepSeek V3、OLMo 2、Gemma 3等模型架构特点,像DeepSeek V3用MLA和MoE提升效率,还探讨线性注意力复兴等趋势。

AGI Hunt
推荐文章7

MCP Server的五种主流架构与Nacos的选择

文章剖析MCP Server五种主流架构模式,结合Nacos服务治理框架,为企业级MCP部署提供指南。介绍各架构优缺点与适用场景,展示Nacos赋能及实战集成,还给出架构选型指南。

阿里云开发者