混合注意力机制」共找到 1161 篇相关文章

新闻资讯7

Karpathy:强化学习「有点问题」,突破还需新算法

前特斯拉AI总监、OpenAI创始团队成员Karpathy发文称,强化学习虽能带来更多收益,但机制「可疑」,不像人类解决智能任务的方式。他提出新算法框架,还指出当前存在诸多待解决的问题。

AGI Hunt
算法论文8

清华唐杰团队揭示大模型记忆全景

清华唐杰教授团队等发布大模型记忆架构综述,提出三维记忆分类学,将前沿工作统一到理论框架,为LLM设计指明方向,分析了隐式、显式记忆架构,还探讨混合架构挑战与未来方向。

量子位
开源动态8

MiniMax M2.5:230B参数仅激活10B,开源模型首次逼近Claude Sonnet,成本仅十分之一

MiniMax推出新一代开源模型M2.5,官方称其为‘为现实世界生产力设计的开源前沿模型’。性能逼近Claude Opus 4.6,采用混合专家架构,成本低。已在内部大规模部署,定位为‘AI员工’。

AI工程化
推荐文章8

2025年AI编程助手大盘点,从微软、亚马逊、谷歌到开源大神

2025年,超八成开发者使用或打算用AI编程助手。文章盘点微软、亚马逊、谷歌等推出的闭源助手,及Cline、OpenHands等开源助手,还从多维度对比闭源与开源方案,指出企业可混合使用。

AIGC开放社区
算法论文8

强化学习也遇到了“天花板”?Andrej Karpathy构建了一个新算法

大神Karpathy肯定强化学习(RL)价值,指出其比监督微调更具扩展性,但存在渐进式学习低效、背离人类学习机制的局限。他提出“第二天性”新范式算法,还面临泛化等挑战。

AI寒武纪
算法论文8

Diffusion约2倍无损加速!训练-推理协同的缓存学习框架来了| HKUST&北航&商汤

HKUST、北航与商汤提出HarmoniCa框架,解决Diffusion模型推理慢、成本高问题。它通过SDT和IEPO机制,解决训练 - 推理脱节,在多模型上实现推理提速、质量提升,且训练推理开销低,已开源。

量子位
开源动态8

GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”

智源研究院发布国产开源统一图像生成模型OmniGen 2.0版本。它增强理解与生成能力,打通多模态生态。玩法简单,技术有创新,还引入反思机制和新基准,推理效率提升,且将全面开源。

量子位
开源动态8

智源新出OmniGen2开源神器,一键解锁AI绘图「哆啦 A 梦」任意门

2024年9月智源研究院发布统一图像生成模型OmniGen,获社区好评。近期OmniGen升级为OmniGen2,增强多方面能力且全面开源。它采用新架构与策略,有反思机制,玩法丰富,还推出新基准优化部署。

机器之心
新闻资讯7

刚刚,全球首个GB300巨兽救场!一年烧光70亿,OpenAI内斗GPU惨烈

为争夺有限GPU,OpenAI内部争斗激烈,2024年算力投入70亿美元仍不够。微软发布全球首台GB300超算专供OpenAI,可让万亿LLM数天训完。OpenAI建立资源分配机制应对挑战。

新智元
开源动态8

社区供稿 | VibeVoice实现90分钟、多角色播客生成,拓展语音合成新边界

微软亚洲研究院提出全新语音生成模型 VibeVoice,采用 next - token diffusion 机制,能将文字脚本转为最长 90 分钟、最多 4 人对话的高质量播客音频,在多方面有显著优势,未来潜力大。

Hugging Face