「多模态专家混合」共找到 1549 篇相关文章
每一幕皆可控!字节发布多主体视频生成神器,人人皆主角
字节发布多主体视频生成神器MAGREF,基于一张参考图像,能生成主体高度一致的视频,多人同台也不串脸。它采用三阶段数据处理流程,构建在DiT架构上,实现复杂视频生成任务。
AI开源狂飙,OpenAI们慌了!GenAI大洗牌,2025趋势深度解读
2025年,ChatGPT仍领跑,但DeepSeek、Qwen等开源模型加速追赶。独立机构报告总结六大趋势,涵盖技术突破与市场格局演变,如推理模型实用化、MoE架构普及等,开源势力挑战闭源巨头。
具身智能空间视觉死穴,终于被最新顶会彻底解决!
招商局先进技术研究院下属实验室提出新的移动数据范式,以极低成本破解 VLA 的空间泛化瓶颈。研究团队识别出 VLA 模型三种捷径学习模式,提出层次化数据解耦策略,该方案在主流 VLA 模型上验证有效。
Codex在推理框架上能蹬出什么优化
作者复盘用Codex在SGLang中的实践,原本需3 - 4个月的工作量现缩短为1个半月。介绍保证代码质量方法,分享印象深刻的debug经历,列举在SGLang用Codex一个月的优化成果,还提及Claude Code使用遇阻。
一年一度最值得关注的AI榜单来啦!申报即日启动
时值第四届中国AIGC产业峰会,量子位将评选2026年度值得关注的AIGC企业和产品,结合调研与专家意见,结果5月峰会公布。参选有条件和维度,报名4月27日截止。
物理AI的「原生」时刻:原力灵机发布具身大模型DM0
主流‘预训练 - 后适配’范式有局限,原力灵机联合阶跃星辰提出具身原生 VLA 模型 DM0。它能统一机器人操作与导航,在 RoboChallenge 测试领先,还介绍了架构、训练方法及未来演进方向。
年前看到最有深度的AI下半场Agents记忆机制综述
本文是一篇83页的基础智能体记忆机制综述,由27家机构联合发表。提出AI研究范式转变,记忆是填补理想与现实差距的关键。构建三维统一分类框架,介绍记忆操作、学习策略、评估体系、应用场景及未来方向。
可灵3.0系列模型正式上线:属于每个人的导演时代来临
可灵AI正式全球上线3.0系列模型,覆盖影视级全流程链路。该系列基于All-in-One理念构建,解决了行业一致性等问题,在多方面做了增强,完成从单点生成到专业调度的跃迁,让AI成创作协作者。
如何科学地“设计”SFT 数据?一次关于 ODA 的完整平台级验证
大模型后训练阶段,SFT数据构建常依赖‘直觉’或‘试错’。上海人工智能实验室OpenDataLab团队发布报告,基于OpenDataArena提出新范式,将数据集构建从‘随机艺术’变为‘确定性工程’,并进行平台级验证。
脑机接口“上车”前夜:科学奇点、临床拐点与产业爆点的三角共振 | GAIR Live 022期预告
2024年初马斯克让人类实现“意念拨弄鼠标”,2026年更放言Neuralink将量产。脑机接口从科研走向商业化,技术、伦理与商业模式待清晰。GAIR Live 022期线上圆桌将探讨其前沿进展与落地挑战。