「短期记忆架构」共找到 2322 篇相关文章
开源音视频同步SOTA基座:极简的单流架构,2秒出片
AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。
刚刚,梁文锋署名开源「记忆」模块,DeepSeek V4更细节了
十几个小时前,DeepSeek 发布新论文,与北大合作,作者有梁文锋。针对大模型问题提出条件记忆,用 Engram 模块实现,已开源。结合此前研究,DeepSeek v4 模样渐清。模型性能、效率表现优,并发现 U 型扩展规律。
万亿参数狂欢!一文刷爆2025年七大顶流大模型架构
文章深入剖析2025年顶级开源模型的创新技术,介绍了DeepSeek V3/R1、Kimi 2、Qwen3等七大顶流大模型架构,揭示滑动窗口注意力、MoE和NoPE如何重塑效率与性能。
英伟达亲手终结CUDA「护城河」?传奇芯片架构师引发争议
英伟达CUDA宣布20年来最重大更新,引入CUDA Tile技术,降低开发门槛。芯片界传奇人物Jim Keller质疑此次更新是否终结CUDA「护城河」,文章分析了相关问题,指出瓦片架构对英伟达内外移植性的不同影响。
Cursor 1.0 正式发布:AI 代码编辑器进入“自动审查 + 记忆”时代!
智能代码编辑器 Cursor 正式发布 1.0 版本,带来多项重磅功能,如自动代码审查助手 BugBot、Jupyter Notebook 原生支持、项目级 AI 记忆等,还提升了用户体验,是向“AI 编程操作系统”迈进的重要一步。
华为新架构砍了Transformer大动脉!任意模型推理能力原地飙升
即便Transformer是AI世界基石,但遇到复杂数学题或多步逻辑推理时表现不佳。问题出在Attention机制。华为诺亚方舟实验室推出Nexus高阶注意力机制架构,能提升模型推理能力,且参数零增。
Anthropic一夜震撼升级:Claude获得「永久记忆」!全球打工人变天
消息人士爆料Anthropic给Claude Cowork重磅升级,知识库注入永久记忆,Cowork模式与Chat模式合并成默认界面。还有UI、自动化、语音等多方面升级,若落地Claude将成生产力搭子,或引发AI办公革命。
成本降九成,准确率100%!MIT反常识架构挑战硅谷信仰
慕尼黑工业大学等研究者指出企业AI落地问题源于数据乱。RUBICON架构用AQL查询语言,把操作权交用户,让LLM在精确范围工作。测试中它准确率100%,成本低,优于现有智能体AI方案。
多模态大语言模型的核心技术架构与训练方法的进化
文章深入剖析多模态大语言模型核心技术架构与训练方法的进化,涵盖建模范式、视觉编码器、语言骨干网络、模态对齐、生成范式及训练方法等方面,介绍其演进路径与代表模型,还提及国内模型创新及开源模型OpenVLA。
创智突破:AI首次自主发现106个超越人类设计的神经网络架构
创智学院团队发布的AI超智能系统ASI - ARCH,自主发现106个超越人类设计的神经网络架构,建立“科学发现缩放定律”,实现从“自动化优化”到“自动化创新”转变,还将成果开源推动研究发展。