「Agent模式」共找到 3398 篇相关文章
AI 基础知识从 0.5 到 0.6—— Transformer 架构为何能统治AI领域?
文章围绕Transformer架构展开,先介绍其诞生背景,对比CNN、RNN等模型,阐述其在多领域的核心地位。接着剖析工作流程、实现原理,包括QKV机制、多头注意力等。最后列举T5、GPT等常见架构模型,并提及通义千问3与MCP协议。
拥抱 AGI 时代的中间层⼒量:AI 中间件的机遇与挑战
文章指出大模型发展呈能力跃迁、生态开放趋势,推动AI应用从聊天机器人向组织级智能体演进。AI中间件可解决应用工程化挑战,但面临上下文管理、记忆更新等难题,短期助力应用规模化,长期或成组织智能“神经中枢”。
DeepMind掌门自曝AGI倒计时5年!算力需求暴增10倍,推理计算吞噬一切
在最新播客中,DeepMind掌门Hassabis表示自然界规律能被机器学习算法模仿。他畅想AGI应用于游戏,还提及迈向AGI要扩大计算规模,算力需求或增10倍,且运营上以初创公司模式兼顾研究与产品。
大模型之后,AI 开始“自己动手”了
从生成式AI到Agentic AI,互联网从“信息获取”转向“任务完成”。全球科技巨头抢滩智能体,国内腾讯云升级智能体开发平台。腾讯吴运声表示,技术与业务需求双轮驱动其发展,还分享了应对落地挑战的办法。
ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键
ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。
ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键
ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极大值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。
深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手
本文深度解读DeepSeek最新发布的V4.1 Flash大模型,详解其全新CED架构与第二代压缩稀疏注意力CSA2,揭秘其通过架构创新大幅压缩KV缓存、降低显存算力成本,在长上下文Agent场景实现性能反超的细节。
本地Opus你要不要!Qwen3.8-27B开源
阿里Qwen团队开源Qwen3.8-27B,上线2天登顶Hugging Face全球大模型趋势榜,下载破百万。其性能超Opus4.6,与顶尖模型相当,量化后普通电脑就能跑,原生多模态,编程、Agent、多模态跑分表现出色。
出海企业苦等的可信任AI营销产品,飞书深诺做出来了
出海生意进入困难模式,不少企业寄望于AI,但现有AI营销产品难达预期。飞书深诺推出Marvy 2.0,将出海营销全流程装进系统,具备技术优势,有13年业务经验等,还计划推Marvy Lite,助力全球数字营销平权。
无锡梁溪国资领投!长三角商业航天再落关键一子
继4月数亿元Pre - A轮融资后,龙擎空天近日完成近亿元Pre - A+轮融资,由无锡梁溪国资平台领投。两轮融资用途明确,其‘终端 + 芯片’模式有独特优势,还启动‘算力上天’战略,折射商业航天产业变革。