非Transformer架构」共找到 2511 篇相关文章

7

看懂这篇,你就能秒懂 LLM底层秘密—Transformer原理解析

文章由浅入深介绍LLM基础知识,着重解析Transformer原理,结合案例讲解其工作流程,还介绍当前开源旗舰LLM架构变化,如DeepSeek V3等模型的创新,最后强调模型能力与应用形态的关系。

腾讯技术工程
推荐文章7

Sebastian Raschka 2026预测:Transformer统治依旧,但扩散模型正悄然崛起

知名AI研究员Sebastian Raschka预测2026年,Transformer架构在未来至少一到几年仍占统治地位,但会在效率和混合上微调。同时,扩散语言模型虽有工具调用缺陷,但在数据稀缺时或成更好的学习者。

机器之心
新闻资讯7

全网破防,AI「手指难题」翻车逼疯人类!6根手指,暴露Transformer致命缺陷

最近网友被AI「手指难题」逼疯,给AI六指手,它始终无法数对。GPT - 5.2、Nano Banana Pro等均翻车。此问题揭露当前模型思考机械、割裂等缺陷,也凸显Transformer架构弱点。

新智元
开源动态8

Qwen3家族训练秘籍公开:思考/思考融进一个模型,大模型蒸馏带动小模型

Qwen3技术报告揭晓8款模型关键技术,采用双模式架构,训练和微调分段进行,还“大带小”蒸馏数据。其融合思考与思考模式,训练分多阶段,Qwen Chat还全量上线深度研究功能。

量子位
算法论文8

SIGIR 2025 | 视频检索新范式!北邮、北大等联合提出AV-NAS:首个音视频哈希搜索架构,让Mamba与Transformer自动“组队”

北邮、北大等团队提出 AV-NAS,在多模态视频哈希领域引入 NAS,构建含 Transformer 与 Mamba 的统一搜索空间。该方法能自动发现最优跨模态融合机制,揭示音频时序建模中“CNN + FFN”结构更优,代码已开源。

AI前线
推荐文章8

从0开发大模型的17种Agent架构演进详细拆解

文章详细拆解从0开发大模型的17种Agent架构演进,介绍各架构解决的问题、状态、拓扑、路由、失败模式等,指出Agent架构本质是控制流设计,还给出架构选择建议及判断新架构的方法。

腾讯技术工程
算法论文8

腾讯混元 TurboS 技术报告首次全公开:560B 参数混合 Mamba 架构,自适应长短链融合

日前腾讯混元 TurboS 技术报告全公开。它是超大型 Hybrid Transformer - Mamba 架构 MoE 模型,有自适应长短思维链机制,总参 560B。在多榜单成绩亮眼,多语种和多任务处理能力强,还介绍了核心创新、训练策略等。

InfoQ
推荐文章8

互联网免费数据已被吃光,普通人反馈早没用了?前英伟达工程师:Transformer的原罪浪费算力,聊天机器人把GPU全糟蹋了

前英伟达工程师、Sail Research 创始人 Neil Movva 认为当前 AI 行业陷“延迟陷阱”,AI 终局应是后台 Agent。他执行“算力拾荒者战略”,想降低智能成本,还指出 Transformer 架构有缺陷,互联网数据被吃光等问题。

AI科技大本营
新闻资讯7

OpenAI 详解规模化低延迟语音 AI 的 WebRTC 架构

OpenAI 介绍为全球规模低延迟语音 AI 调整 WebRTC 架构,将传统媒体终结模型换为中继收发器架构,分离职责,避免复杂逻辑堆砌与转嫁。此架构为实时语音技术布局补充基础设施细节,对架构师有参考价值。

InfoQ
推荐文章7

在 AI 增强的变革流中,架构师要承担何种角色?

数据显示多数组织采用AI却未获实质价值,技术进步但组织影响参差不齐。架构师可弥合组织目标与开发速度的鸿沟,利用AI增强架构实践,案例展示了架构流动性在实践中的体现。

InfoQ