记忆模块」共找到 750 篇相关文章

算法论文7

Transformer与RNN合体,谷歌打下显存门槛,解锁超长上下文

谷歌论文提出 Memory Caching 技术,通过架构机制创新赋予 RNN「可生长的记忆容量」,兼顾 Transformer 与 RNN 优势,能处理更长文本、降低推理资源门槛,实验显示有良好效果。

机器之心
开源动态8

清华开源|做一门课要3天?用 OpenMAIC,30分钟生成完整互动课堂|GitHub 15.6k

OpenMAIC 是清华开源的 AI 互动课堂平台,能将主题或学习材料快速转化为完整互动学习体验。它把课堂拆成多种交互组件,架构设计出色,支持多 LLM 服务商,还能在聊天应用生成课堂。

小华同学ai
新闻资讯8

YC 专访 OpenClaw 创始人:80% 的 App 将会消失,我们还剩下什么?

YC 深度访谈 OpenClaw 创始人 Peter Steinberger。他本是半退休开发者,因 AI 智能体 Moltı 爆火。他认为 AI 应回硬盘,OpenClaw 能控制设备、处理文件。还谈到机器人雇佣人类、80% App 将消失等观点。

AI科技大本营
推荐文章8

AI Agent 总翻车?这篇综述戳破了 3 个关键误区

很多团队做AI Agent停留在‘LLM+工具’表面拼接,运行易出问题。该综述指出AI Agent是‘系统’,介绍其架构,还给出常见误区的应对方法、落地检查清单,展望应用前景。

CourseAI
算法论文8

NeurIPS 2025 Best Paper | 扩散模型不为人知的“时间差”:为什么先学会创作,后学会抄袭?

深度学习中,扩散模型能生成新图像且抗过拟合。巴黎高师和博科尼大学研究团队论文指出,这源于隐含的动力学正则化,训练分两阶段,数据量增加会拉开‘泛化窗口’,还给出数学解释。

深度学习自然语言处理
开源动态8

DeepSeek开源的不仅仅是个新OCR模型。。。

DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。

AI工程化
推荐文章8

麦肯锡调研了 50 个一线 AI 智能体的项目总结出来的六条经验

麦肯锡调研50个AI智能体真实项目,提炼出开发智能体的6个关键因素,如关注整体流程、明确适用任务、避免制造“AI垃圾”等,助企业从智能体中捕获价值。

宝玉AI
产品应用8

字节发了个机器人全能大模型,带队人李航

字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。

量子位
推荐文章7

「Tokens是胡扯」,Mamba作者抛出颠覆性观点,揭露Transformer深层缺陷

Mamba作者Albert Gu在博客中探讨状态空间模型(SSM)和Transformer权衡,抛出‘Tokens是胡扯’观点,揭露Transformer深层缺陷,如分词问题、处理噪声能力弱等,还分析两类模型特点及结合优势。

机器之心
推荐文章7

AI Agents,年中总结!

文章梳理6月旧金山AI Engineering World's Fair重磅分享,指出AI Agent发展方向是成为自主处理复杂工作的助手,还介绍了Ambient Agents崛起、Agent UX设计两派观点、训练进入RL时代等关键趋势。

探索AGI