「模型架构升级」共找到 8874 篇相关文章
华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」
今年文本生成领域从自回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在多基准创 7B 参数量级 SOTA,还解析了其技术革新。
阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天
阿里发布原生流媒体端到端模型Wan - Streamer v0.1,能实时聆听、观看、思考、说话和响应视频。它在单个Transformer内完成感知等操作,延迟低,具备端到端多模态统一、低延迟等特点。
李飞飞的创业公司放大招:只要一个 H100 就能跑世界模型
“AI 教母”李飞飞的创业公司 World Labs 推出高效世界模型 RTFM,只需一个 H100 GPU 就能一边和用户交互,一边实时渲染 3D 世界,显著降低硬件成本和部署难度,渲染效果也不俗。
谷歌Transformer过时了?清华姚班校友等三连击,爆改注意力!
谷歌提出新架构,参数减少40%,训练速度较RNN提升5 - 8倍,某些任务性能超Transformer 7.2%。新架构引入注意力偏向策略,用「保留」取代「遗忘」,还提出Moneta、Yaad、Memora三个新模型,在多任务上表现卓越。
AI终于学会「读懂人心」,带飞DeepSeek R1,OpenAI o3等模型
威斯康星大学麦迪逊分校联合清华的研究《MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems》,将元认知理论融入LLM架构,使模型在心智理论测试达人类平均水平,揭示构建社交智能AI方法论。
碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强
国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。
DeepMind 最新研究:智能体就是世界模型!
DeepMind研究科学家Jon Richens团队在ICML 2025发表论文,从第一性原理证明智能体就是世界模型,回答了AI界多年的根本问题,还带来多个有趣推论,引发AI社区热烈讨论。
AI终于学会「读懂人心」,带飞DeepSeek R1,OpenAI o3等模型
威斯康星大学麦迪逊分校联合清华大学的研究《MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems》,将元认知理论融入LLM架构,让AI“读懂人心”。其框架分三阶段,还有动态社交记忆,在多基准测试表现出色。
谷歌Ironwood架构TPU v7:用AI造AI,撼动英伟达芯片帝国
11月25日谷歌云发布第七代定制芯片Ironwood,由AlphaChip设计。它以9.6 Tb/s光互联带宽和1.77 PB共享显存池重构大模型推理硬件基准,挑战英伟达芯片地位,展现AI算力竞争新趋势。
SmolVLA: 让机器人更懂 “看听说做” 的轻量化解决方案
文章介绍轻量级开源视觉 - 语言 - 动作 (VLA) 模型 SmolVLA,专为机器人领域设计,可在消费级硬件运行。它用公开数据集训练,架构经优化,还引入异步推理堆栈,性能超部分大模型,降低研究门槛。