「全模态统一建模」共找到 815 篇相关文章
这帮清华的,造了一个让龙虾“安全着陆”的新物种
在OpenClaw热潮中,隐私保护缺位成企业和开发者难题。无问芯穹推出InfiniClaw Box,独创‘三段式’架构,适配全模态信源,解决数据安全与模型能力兼顾问题,还与多家企业合作拓展应用边界。
还在为AI数据发愁?张文涛和鄂维南院士团队推出Data-centric AI系统
近年来大模型发展由科技公司主导,其数据资源不公开,学术界构建优化数据难。张文涛和鄂维南院士团队推出DataFlow系统,可实现数据治理,有算子和流水线,支持文本模态,多模态版待推出。
破解MoE模型“规模越大,效率越低”困境!中科院自动化所提出新框架
大模型参数量飙升却陷入‘规模越大,效率越低’困境,中科院自动化所研究团队提出统一框架,直击MoE底层运作模式,让专家‘组队学习’,实现参数量、负载方差降低,达成三重优化。
破除水军机器人!北航团队发布全新对抗性框架SIAMD:用“结构信息”破译机器人伪装|IEEE TPAMI
本文介绍北航彭浩团队发表在TPAMI 2025的文章,提出对抗性框架SIAMD检测机器人。它将用户账户与消息交互组织为异质结构,用结构熵建模。实验显示,其在有效性、泛化性等方面优于基线模型。
AdaGen: 让图像生成模型学会自适应策略
当前主流图像生成模型多步策略依赖手工静态调度规则,存在需大量调参、无法适配样本特性的问题。本文提出AdaGen框架,通过强化学习训练策略网络,在四大生成范式上实现性能提升与效率优化。
AI玩拼图游戏暴涨视觉理解力,告别文本中心训练,无需标注的多模态大模型后训练范式
在多模态大模型后训练浪潮中,现有方法多以文本为中心。MMLab@南洋理工大学提出Visual Jigsaw,将拼图任务用于后训练,让模型不依赖标注强化视觉感知与理解,在图片、视频和3D模态验证有效。
视觉模型既懂语义,又能还原细节,南洋理工&商汤提出棱镜假说
南洋理工与商汤团队提出 Prism Hypothesis(棱镜假说)与 Unified Autoencoding(UAE)。论文指出视觉基础模型中语义理解和像素保真很难兼得,用频率谱统一视角解决冲突,UAE 实验效果良好。
阿里通义实验室出品!全新 GUI 智能体 MAI-UI,精准操控你的手机
阿里通义实验室推出 GUI 智能体模型家族 MAI - UI,覆盖多种规模。针对当前 GUI 智能体问题,采用统一方案让模型更强。在多项任务中刷新行业成绩,有性能提升与隐私保护双收益。
MoCa:首个大规模双向多模态表征模型
为解决VLM用于嵌入的痛点,中国人民大学等机构研究者提出MoCa框架,可将单向注意力VLM训练成双向多模态编码器。它分两阶段,实验效果好,未来可拓展模态、提升多语言适应等。
Bun 推出内置数据库客户端与零配置前端开发
Bun 发布 1.3 版本,是迄今最大更新,实现全栈开发,推出统一数据库 API 并提升性能。引入零配置前端开发模式,有内置 Redis 客户端,社区反响不一,还扩展包管理功能,性能提升显著。