「生成式深度学习」共找到 3979 篇相关文章
NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026
本文整理自新加坡国立大学Show Lab负责人寿政教授在ECCV 2026的分享,团队研发融合自回归与离散扩散的Show-o/Show-2统一架构,解决多模态理解与生成融合痛点,延伸至具身智能领域,突破数据稀缺、推理延迟等核心瓶颈。
刚刚,HiDream-O1-World首秀登顶,原生全模态UiT架构打造「可交互时代」
过去三年,AI 内容生成行业虽有技术迭代,但用户与模型交互仍单向。智象未来发布全球首款原生全模态交互式世界模型 HiDream - O1 - World,它基于 UiT 架构,在评测中表现出色,解决两大行业难题,应用前景广。
百度智能云 DuMate 测评:办公 Agent 教我用 Claude Code,效果如何?
百度智能云桌面级AI智能体DuMate于今年3月22日全量上线。本文对其进行测评,设计围绕GitHub项目的复杂任务,测试它在研究、整理、文件生成和展示化输出的表现,探讨办公Agent从内容提供商到办公搭子的转变。
AI5芯片搞定,马斯克的纯自研超算Dojo 3又回来了
马斯克宣布AI5芯片设计进展顺利,特斯拉将重启Dojo 3工作。Dojo项目定位为面向机器学习训练的超算,此前曾暂停。如今Dojo 3将集成AI5或AI6芯片,有望助力特斯拉摆脱对英伟达依赖,自建算力体系。
从算法天才到机器人造梦者,原力灵机范浩强详解具身智能进化论:模型解锁场景,场景定义硬件
AI 前线深度访谈原力灵机范浩强,探讨其创业选择、具身智能技术演进与产业趋势。他认为机器人是 AI 绕不过的点,2025 年硬件与算法拼图开始对齐,原力灵机强调算法先行,还分享了保证算法演进的路线。
半佛怕爆款,三表拒AI,冰汝谢川普
在短视频和 AI 席卷内容行业的当下,今日头条 2025 年深度创作者大会上,驻美记者王冰汝、财经博主半佛仙人、自媒体人三表龙门阵分享了各自的焦虑与坚守。他们谈到爆款、AI 影响、创作模式等问题,展现不同生存哲学。
通过零开销逐层权重卸载技术将SGLang Diffusion wan2.2的推理速度加速60%
文章介绍在优化SGLang对Wan2.2视频生成模型支持时,发现双Transformer架构下第1步和第19步推理慢的问题。通过零开销逐层权重卸载技术,将整体推理速度提升60%,还突破显存墙,且该优化可扩展到其他模型。
vivo AI Lab提出自我进化的移动GUI智能体,UI-Genie无需人工标注实现性能持续提升
香港中文大学MMLab和vivo AI Lab团队提出自我进化框架UI - Genie,构建奖励模型UI - Genie - RM解决轨迹验证难题,通过数据生成和模型迭代闭环实现智能体与奖励模型双向增强,在多基准测试中表现出色,打破人工标注瓶颈。
开源Agent模型榜第一名,现在是阿里通义DeepResearch
阿里开源首个深度研究Agent模型通义DeepResearch,在多权威评测集上超越多个Agent模型。它采用多阶段数据策略,有两种推理模式,革新训练流程,已赋能高德出行Agent和通义法睿等应用,且模型等均已开源。
英伟达&MIT等推出Long-RL,长视频训练速度翻倍
英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。