「动态混合专家架构」共找到 1009 篇相关文章
规范驱动开发落地经验谈:为什么 AI 编程的关键不在模型,而在协作方式
文章指出 AI 编程关键在协作方式,规范驱动开发(SDD)应运而生。它有诸多价值,但落地面临工具短板等挑战。企业可将其适配现有工作流,长远看需将规范作为动态指南,实现智能体编排开发的质量转变。
刚刚,GPT-5.2满分屠榜,OpenAI十周年王者归来
OpenAI 十周年推出 GPT - 5.2 系列模型,包括 Instant、Thinking 和 Pro 版本。它在多方面表现出色,刷新多项基准测试 SOTA 水平,如 AIME 2025 获满分,在 GDPval 达人类专家水平。还在编码、视觉理解等能力上有显著提升。
对话ACE Studio:做AI音乐、月收入200万美元,我们选了一条和Suno截然不同的路
ACE Studio 切入 AI 音乐市场,与 Suno 路径不同,从专业用户入手,月收入达 200 万美元。其模型轻且快,还自建专家模型矩阵。商业模式采用开源免费吸引用户,闭源变现。认为 AI 音乐个性化是关键,未来将改变音乐产业。
全球首次,Transformer「混血」速度狂飙65倍!英伟达已下注
康奈尔、CMU等机构研究者提出「混合体」Eso - LM,融合自回归和离散扩散模型范式。它引入KV缓存机制,推理速度相比标准MDM提升65倍,在速度与质量平衡上超越BD3 - LM,引发AI领域关注,英伟达或押注此方向。
Qwen3-Next全新架构,32K场景MTP吞吐提升10倍
随着模型大小和上下文长度增加,为应对成本和部署挑战,Qwen3 - Next有突破性架构创新,解决上下文长度和总参数缩放问题。它采用混合注意力、超稀疏MoE等,MTP机制让其长上下文推理吞吐量比前身高10倍以上。
解决扩散模型过拟合的创新框架T-LoRA
预训练大型文本到图像扩散模型定制化时,样本有限易致过拟合。AIRI和HSE大学团队提出T - LoRA框架,动态调整训练能力、用正交初始化,实验显示其在单图像和多图像任务表现优,用户更偏好其生成图像。
万字实录:VLA 范式,具身智能的曙光与迷雾丨GAIR Live
2025年5月9日,雷峰网等举办“具身智能之VLA的实践与突破”线上圆桌沙龙。多位专家探讨VLA定义、起源、技术路线等,指出其面临推理、数据等瓶颈,还讨论了与强化学习结合、数据选择、提升泛化性、长程任务及落地场景等问题。
媲美DeepSeek!腾讯开源新版混元模型:AI Agent强化,超30种智能体指令
腾讯开源混元大模型最新版本Hunyuan - A13B,为专家混合模型,有800亿参数,130亿激活。支持快慢思考模式,针对AI Agent强化,设计超30种智能体指令。测试成绩超DeepSeek - R1等,架构和训练有优化。
30万被引的AlphaGo之父,创业4个月融资近百亿元!笃信RL实现ASI
4月27日,AlphaGo之父David Silver创办的Ineffable Intelligence获11亿美元种子轮融资,投后估值51亿美元。该公司押注强化学习和自我经验学习,试图挑战大模型主线。未来或采用大模型预训练和强化学习混合路线。
容器可观测新视角: SysOM延时监控助力定位业务抖动原因
云原生场景下,资源超卖和混合部署使宿主机与容器化应用资源竞争加剧,引发内核级延迟问题。本文结合实战案例,介绍用ack - sysom - monitor Exporter分析定位内核延迟,还介绍了SysOM监控及解决系统延时的方法。