「可控生成技术」共找到 4705 篇相关文章
阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒
4月27日,阿里巴巴视频生成模型HappyHorse 1.0开启灰测,全球专业创作者和企业级客户可在官网和阿里云百炼平台注册使用,大众用户可在千问App体验。官网720P视频生成刊例价0.9元/秒,专业会员包月叠加限时折扣后低至0.44元/秒。
国产芯片也能跑AI视频实时生成了,商汤Seko 2.0揭秘幕后黑科技
自Sora 2发布,科技厂商掀起视频生成模型竞赛。12月15日商汤上线Seko 2.0,实现AI短剧‘一人剧组’。其背后的LightX2V框架做到实时生成,还适配国产芯片,有望推动视频创作生产力革命。
理解与生成统一多模态模型:现状与未来 | 直播预约
从GPT - 4o到Gemini,AI实现跨模态联合理解与生成,核心是统一多模态基础模型。但开源社区构建强大统一模型面临挑战。南大等团队梳理超750篇论文分析技术路线,将有直播探讨现状与未来。
Agent面向结果交付,技术正从单点突破加速转向工程与系统竞争 |《中国软件技术发展洞察和趋势预测研究报告 2026》正式发布
2025 年技术热点不断,竞争重心从单点突破转向系统级等竞争。InfoQ 研究中心发布《中国软件技术发展洞察和趋势预测研究报告 2026》,盘点技术发展,还展望 2026 年十大技术趋势。
从「片段生成」到「长视频漫游」:OmniRoam探索轨迹可控的长视频生成新范式
在生成式视频发展中,长时序视频生成面临挑战。研究者提出 OmniRoam 新方法,通过全景表示和分阶段生成框架,提升视频时空一致性,还构建数据评测体系,实验表现优,有效率和 3D 应用潜力。
首个故事可视化综合评估框架来了!80个故事单元53种类别,20种技术方案全面对比
随着AIGC技术进步,故事可视化引发关注。阶跃星辰携手上科大、西湖大学提出ViStoryBench可视化评估框架,通过构建多元化数据集、建立多维度评估指标,对超20种技术方案评测,为行业发展提供评估工具。
腾讯祭出开源核弹!LeVo音乐生成模型,媲美Suno,支持零样本风格迁移,歌词完美匹配
音乐生成领域有重大突破,腾讯AI Lab开源高保真音乐生成模型LeVo。它由LeLM和音乐编解码器组成,能解决现有方法在音质、音乐性等方面的局限,实验显示其优于现有方法,功能强大且适用场景多。
盛大AI研究院新作:流式生成超越非流式,一句话让虚拟人动作丝滑如真,推理延迟仅1帧
盛大AI研究院与东京大学联合提出FloodDiffusion,首个基于定制化扩散强制的流式人体动作生成框架。它能零延迟生成无限长动作序列,解决了现有方法的问题,在多数据集评估中表现优异。
更少的token生成更好的图!香港大学联合阶跃星辰等让AI绘画真正理解了再画
香港大学、阶跃星辰等用VFMTok新方法,让图像生成模型借用顶级视觉AI的眼睛看世界,实现更快、高质量图像生成,且无需复杂引导技巧。它改变图像理解方式,将像素死记硬背转为语义理解。
2026 奇点智能技术大会上海站来袭,解码AI Agent、世界模型与氛围编程等新范式
2026奇点智能技术大会·上海站4月17 - 18日召开。AI正成变革性力量,此次大会升级聚焦AI规模化落地,设十二大专题,有多位出品人与演讲嘉宾带来实践经验与技术洞察,还开放合作与分享者申请。