「扩散生成技术」共找到 4712 篇相关文章
写2000字提示词,不如先一键生成3D白模!AI视频创作进入“预演时代”
随着AI模型能力增强,科班人士利用其专业能力在AI视频创作赛道优势明显。updream预演台将影视行业预演工作流引入创作画布,解决了AI视频生成中‘拍什么’和‘怎么拍’的问题,虽有局限但意义重大。
开源复现o3图像思考!快手让AI不再被动看图,模型自主生成代码调用工具
Kwai Keye团队提出Thyme新范式,构建技术方案,赋予开源模型“超越图像思考”能力。包括设计训练策略、构建开源配套资源,拓展多模态模型工具使用与决策水平,在基准测试中性能提升显著。
GLM-5.1夺开源模型第一,长程任务更稳,一句话就能生成文章短视频
智谱官宣GLM-5.1开源,代码能力增强,在三项代码评测基准综合平均分上,取得全球模型第三、国产及开源模型第一。它专为长程任务设计,能8小时持续工作,还能一句话生成短视频,是平替Claude Sonnet 4.6的优选项。
美团提出全新多模态统一大模型STAR,GenEval突破0.91,破解“理解-生成”零和困局
近日美团推出多模态统一大模型 STAR,以“堆叠自回归架构 + 任务递进训练”实现理解与生成双重突破。它解决行业痛点,通过三大核心设计统一能力,实验在多任务中表现顶尖,还给出后续探索方向。
GRPO训练不再「自嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化
GRPO在视觉生成流模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务中表现良好。
Agentic AI 要终结数据库和 SaaS?大厂掌门人公开互撕,焦虑的 CEO 们押上了不同的技术路线
2025年Agent成AI热词,科技巨头与初创公司纷纷布局。微软和Salesforce掌门人公开“互呛”,代表两种不同落地路径。前者主张通用框架,后者强调垂直集成。当前二者Agent均有落地,但面临技术、成本等挑战。
腾讯混元开源世界模型!2.0版本一键生成3D空间,游戏关卡随心造
4月16日,腾讯正式发布并开源混元3D世界模型2.0(HY - World 2.0)。它是多模态模型,能理解多种输入,自动生成、重建和模拟3D世界,支持多格式3D资产导出,可与游戏工作流对接。
智谱终于发布GLM-4.5技术报告,从预训练到后训练,细节大公开
上个月底智谱开源 GLM-4.5 及轻量版,成绩亮眼引热议。现其技术报告发布,详述预训练到后训练细节,还介绍了开源 RL 框架 slime,展示模型架构、训练阶段等,评估了在多任务上的表现。
Qwen深度研究一夜升级!可生成网页和音频播客,新模型能认医生手写体
Qwen版深度研究加速进化,增加听觉和视觉输出,可生成网页和音频。改进功能同时更新模型,Qwen3 VL能识别医生手写体。实测新功能表现出色,Qwen3-VL系列更新后性能优异。
DeepSeek揭秘o1后,小红书似乎破解了o3的技术路线,还开源了~
OpenAI闭源后,大家不知其先进模型技术路线,解密成重要任务。DeepSeek R1年初开源后引发关注,小红书团队核心贡献的论文似破解o3谜题,还开源模型等,为训练调优提供可行路线。