注意力残差」共找到 555 篇相关文章

推荐文章7

万字长文!大模型LLM推理优化技术总结

文章围绕大模型LLM推理优化技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优化、模型优化和模型服务等技术,如Pipeline并行、MQA、量化、动态批处理等。

OpenMMLab
新闻资讯7

AI重新打开了创业窗口期?数据告诉你真相

移动互联网红利结束后创业圈寒冬漫长,2025 年起 AI 创业融资回暖,但资金集中于头部公司。AI 使创业成本断崖式下降,一人公司兴起,不过 AI 创业失败率仍高。真正的创业窗口期属于有行业认知、能异化定位且善用 AI 的人。

AI Reading Hub
推荐文章8

想成为一名合格的 AI PM,先抛弃过去那些让你成功的经验

文章指出 AI 产品经理与传统产品经理不同,AI 是会演进的系统。掌握 AI 产品策略是 PM 首要技能,从方向、异化、设计、部署、领导力五阶段构建策略,还介绍了结构化实验方法,无策略的 PM 将被淘汰。

Founder Park
产品应用8

WAIC现场最“聪明”展台!AI眼睛耳朵能力全打开了

WAIC现场,声网展台被观众挤爆,其新奇“AI玩具”都能与玩家流畅对话。声网对话式AI引擎全新升级,新增选择性注意力锁定、视觉理解能力,能与主流数字人方案集成,还可接入大模型,价格低。它已在多领域落地。

量子位
产品应用7

终于有人解决机器人洗手洗澡问题了

杭州云深处发布全新人形机器人DR02,全球首款具备IP66防护等级,可防尘防水,能在复杂户外环境稳定运行。云深处从四足迈向两足,借户外作业经验走出异化路线,加速人形机器人商业化。

量子位
产品应用7

Qwen3-Next全新架构,32K场景MTP吞吐提升10倍

随着模型大小和上下文长度增加,为应对成本和部署挑战,Qwen3 - Next有突破性架构创新,解决上下文长度和总参数缩放问题。它采用混合注意力、超稀疏MoE等,MTP机制让其长上下文推理吞吐量比前身高10倍以上。

CourseAI
开源动态8

MiniMax-M1:全球首个开源超长上下文大模型,超越DeepSeek-R1,推理成本仅1/4

MiniMax-M1是全球首个开源超长上下文大模型,刷新三项记录。它采用混合专家架构,闪电注意力让推理复杂度近乎线性增长。CISPO算法加速训练,成本低。在工业级任务测试表现佳,已开源且方便开发者接入。

深度学习自然语言处理
开源动态8

腾讯开源三大具身基座模型,首席科学家张正友详解“三层脑”如何破解机器人反应慢

WAIC 2026 期间,腾讯开源三款具身基座模型。首席科学家张正友称此前用 OpenClaW 调度机器人效果,后设计 TairosAgent 框架。腾讯将具身智能拆成三层,配合具身智能体和框架构成完整矩阵,还解决语言信息不足等问题,并在工业和养老场景测试。

InfoQ
产品应用7

构建能源领域的AI专家:一个多智能体框架的实践与思考

本文介绍阿里团队在能源领域构建多智能体框架的实践。因单智能体处理复杂任务有“注意力发散”问题,团队研发综合能源智能体平台,阐述框架搭建、各组件功能及设计考量,还分享思考与可优化点。

阿里云开发者
新闻资讯8

机器学习先驱Daphne Koller警告:AI制药不是魔法棒,下一代药物发现还缺1000倍数据

知名学者 Daphne Koller 在 a16z News 发文指出,AI 制药当前最受关注的进展多在分子设计,但新药研发难题在上游,疾病机制的靶点选择错误导致大量临床试验失败,且当前数据距构建完整生物学因果模型约 1000 倍。

DeepTech深科技