「动作生成大模型」共找到 8722 篇相关文章
混元3D世界模型1.0 lite版本发布,消费级显卡就能跑
腾讯混元3D世界生成模型HunyuanWorld 1.0发布即开源,可在消费级显卡运行,还能兼容传统CG管线。它分层实现3D生成,通过量化等技术降低显存开销,与同类模型相比优势明显。
不用千亿参数也能合成高质量数据!这个开源框架让小模型“组团逆袭”,7B性能直追72B
上海人工智能实验室与中国人民大学提出GRA框架,以“多人协作”理念让小模型分工生成高质量训练数据。实验显示其生成数据质量高,项目已开源。它打破对大模型蒸馏依赖,展现“集体智能”潜力。
突破视觉-语言-动作模型的瓶颈:QDepth-VLA让机器人拥有更精准的3D空间感知
视觉 - 语言 - 动作模型(VLA)在机器人操控领域潜力大,但应对长时序或精细操作任务时性能下降,根源是缺乏三维空间感知与推理能力。中国科学院自动化研究所与灵宝 CASBOT 提出 QDepth - VLA 模型,提升了机器人空间推理与操控精度。
GLM-5.1夺开源模型第一,长程任务更稳,一句话就能生成文章短视频
智谱官宣GLM-5.1开源,代码能力增强,在三项代码评测基准综合平均分上,取得全球模型第三、国产及开源模型第一。它专为长程任务设计,能8小时持续工作,还能一句话生成短视频,是平替Claude Sonnet 4.6的优选项。
加速200倍,单显卡1.8秒生成5秒高清视频!清华与Vidu解开了视频扩散模型的速度枷锁
清华、生数科技与伯克利联手用TurboDiffusion解开视频扩散模型速度枷锁。它改造注意力机制、引入步数蒸馏和量化策略,在多模型测试中加速100 - 205倍,且画质几乎无损。
732M模型超越7B!机器人操控新范式:从视频中「悟」物理
机器人操控有「数据困境」,传统方法需大量人工标注动作演示数据。中山大学王广润教授团队从视频生成模型「借」物理直觉,提出PAR和PhysGen,与英伟达DreamDojo核心思路一致,验证了新的技术路线。
“甲方快乐模型”诞生,拿下平面设计新SOTA!多条件一键生成,还能独立调整元素 | 复旦&字节
复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、多模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在多维度评估基准上表现出色,还支持多轮编辑。
清华联手英伟达打造扩散模型新蒸馏范式!视频生成提速50倍,4步出片不穿模
清华大学朱军教授团队与NVIDIA Deep Imagination研究组联合提出分数正则化连续时间一致性模型(rCM),将连续时间一致性蒸馏扩展至大模型,解决现有方法瓶颈,提升推理速度兼顾质量与多样性。
阿里又上新!开源 7B 文生图模型,专治图中文字,效果媲美 20B+ 大模型!
阿里 AIDC - AI 团队开源 7B 参数文生图模型 Ovis - Image,主打图中文字生成。它文本渲染能力强,在权威榜单成绩好,媲美 20B + 大模型,官方还提供使用方法,是设计类刚需模型。
多模态大语言模型的核心技术架构与训练方法的进化
文章深入剖析多模态大语言模型核心技术架构与训练方法的进化,涵盖建模范式、视觉编码器、语言骨干网络、模态对齐、生成范式及训练方法等方面,介绍其演进路径与代表模型,还提及国内模型创新及开源模型OpenVLA。