「全模态生成」共找到 3854 篇相关文章
社区供稿 | Hugging Face x 北京中关村学院等机构联合发布生成式基因组大模型Carbon:一场关于“生命语言”的范式革命
北京中关村学院等联合发布生成式基因组大模型Carbon并开源。Carbon家族有三个版本,旗舰模型Carbon - 3B在多任务匹敌70亿参数的Evo2 - 7B,运行速度快275倍。它在数据、分词、训练上有创新,还实现技术普惠,有多种应用场景。
生成视频总出物理bug?用VLM迁移+token级对齐,让燃烧在正确位置发生,碰撞遵循动量守恒丨CVPR 2026近满分接收
现有生成式视频模型多停留在“外观拟合”,未真正“物理建模”。中山大学等机构提出ProPhy,构建渐进式物理对齐框架,使模型有“分层物理理解”与“空间物理对齐”能力,论文被CVPR2026近满分接收。
AI生成视频总不符合物理规律?匹兹堡大学团队新作PhyT2V:不重训练模型也能让物理真实度狂飙2.3倍!
匹兹堡大学团队提出 PhyT2V 框架,论文已被 CVPR 2025 接收。该框架不依赖重训练或大量外部数据,通过链式推理与迭代修正机制,增强主流 T2V 模型物理场景泛化与生成能力,应用前景广。
RL加持的3D生成时代来了!首个「R1 式」文本到3D推理大模型AR3D-R1登场
强化学习首次被系统性拓展到文本到3D生成领域,上海人工智能实验室等机构研究者提出首个强化学习增强的文本到3D自回归模型AR3D - R1,还提出Hi - GRPO范式和MME - 3DR基准,实验显示其性能优异。
超越OpenAI、拿下全球双料第一,“AI吴彦祖”背后大模型SOTA了!
国产大模型MiniMax发布Speech - 02,拿下两项全球权威语音基准测评第一,是榜单前十唯一国产玩家。它超拟人、个性化、多样,技术创新,且在多行业落地,全模态布局领先。
硅谷8巨头夜会遭「宿管阿姨」驱散?AI造假首次让「肉眼死亡」
新智元报道,一张谷歌Nano Banana Pro生成的AI合影疯传,效果乱真。该模型在LMArena榜单屠榜,玩法多样,如按坐标出图等。谷歌全栈优势明显,OpenAI感受到压力正酝酿反击。
这帮清华的,造了一个让龙虾“安全着陆”的新物种
在OpenClaw热潮中,隐私保护缺位成企业和开发者难题。无问芯穹推出InfiniClaw Box,独创‘三段式’架构,适配全模态信源,解决数据安全与模型能力兼顾问题,还与多家企业合作拓展应用边界。
火线解析MiniMax招股书!全球领先大模型成本只有OpenAI 1%,果然拳怕少壮
上海大模型独角兽MiniMax通过港交所聆讯冲刺IPO。它是全球化AGI科技公司,全模态能力领先且成本低。技术上各模态模型表现出色,采用“模型即产品”模式获客,财务业绩向好,团队年轻高效。
这个开源模型的UI审美碉堡了~
当下流行基于大模型生成HTML源码可视化文本内容,网页审美对模型很难。早期用Claude 3.7,后有DeepSeek V3 0324等。Tesslate开源基于Qwen微调的模型,尺寸全,审美佳,想象空间大。
劝视频博主别拿龙虾起号,7×24小时全自动,碳基生物真卷不过
X上网友分享的AIVideo Agent可7×24小时全自动完成视频制作流程,上手无技术难度,还能与多平台集成。AIVideo.com功能全,实测生成速度快且操作空间大,或改写传统视频生产流程。