全注意力机制」共找到 2720 篇相关文章

新闻资讯7

Le Chat方面对标ChatGPT,欧洲AI新贵穷追不舍

欧洲AI初创公司Mistral AI接连发布多个开源模型,还升级Le Chat,引入深度研究、语音等新功能,方面对标ChatGPT。其语音识别模型Voxtral号称“球最佳”,多方面超越竞品。

机器之心
产品应用7

好奇心之旅:Cursor代码库索引机制的学习笔记

作者作为高德信息工程团队AI先锋队一员,日常用Cursor开发,因好奇其代码库索引机制展开探索。介绍了Cursor索引工作流程、隐私安等,还研究Merkle树、turbopuffer向量库及开源方案Continue。

阿里云开发者
推荐文章7

AI研发新范式:基于技术方案链路生成代码

文章指出过往代码补方式存在局限,腾讯广告审核团队探索新AI开发范式。介绍业界AWS、Lovable范式,阐述审核团队实践范式,含定义、技术选型、过程标准化等,还提及进展、困难与未来展望。

腾讯技术工程
产品应用8

面壁MiniCPM-SALA模型,稀疏-线性注意力,单卡吞吐百万上下文

面壁智能团队提出SALA,基于此训练的MiniCPM-SALA模型,在单张A6000显卡实现百万token超长上下文推理,训练成本降约75%。它结合稀疏与线性注意力,采用混合架构,继承权重降低成本,在长文本处理上优势明显。

AIGC开放社区
开源动态7

【7.2K Star】Google 基于LangGraph打造栈Deep Research

谷歌开源Deep Research栈应用,前端用React(with Vite)和Shadcn UI,后端研究代理用LangGraph,需Redis和Postgres数据库,LLM用Google Gemini,网络搜索用Google Search API,还介绍了Agent执行流程。

CourseAI
产品应用8

你们催更的模型,云栖大会一口气发了!

云栖大会上新6款模型、发布1个新品牌,覆盖多场景。如Qwen MAX万亿参数大模型能力登顶国际榜单,Qwen3 - Omni实现模态不降智等,各模型能力升级显著,现已同步上线。

阿里云开发者
新闻资讯7

人在美国,待过三家AI Lab,凉了!

科技行业大裁员,Meta裁掉老将田渊栋,AI从业者人心惶惶。南洋理工大学副教授Boyang Li工作过的三家工业研究实验室倒闭,他分享经历,探讨工业研究困难的原因。

新智元
推荐文章7

ChatGPT 为什么越来越“懂你”?一文解析它背后的记忆机制

今年4月,OpenAI对ChatGPT记忆系统重磅升级,可参考过往对话提供个性化响应。软件工程师Eric Hayes拆解其双重记忆架构,推测实现机制,探索对用户体验的重塑。

AI科技大本营
算法论文8

微调已死!「共识机制」实现提示词自我进化,性能飙升

人工智能领域正从「模型微调」向「上下文工程」转变。西湖大学MAPLE实验室齐国君教授团队提出基于「共识机制」的提示词组进化算法C - Evolve,能突破单一提示词性能局限,提升系统整体性能。

量子位
开源动态8

开源即爆火!英伟达重磅推出OmniVinci模态大模型

英伟达在华盛顿GTC大会开源OmniVinci模态大语言模型,实现视觉、音频、语言统一理解。它性能超竞品,架构有创新,数据引擎庞大。实验有重要洞察,在多场景表现佳,代表新AI范式。

机器之心