「全模态生成」共找到 3849 篇相关文章
国内首个!加入六维力的全感知数采,让VLA模型进化出力触觉
具身智能发展受数据采集制约,开普勒机器人发布国内首个原生全感知力触数采系统,打通全链路闭环。该系统具平台化特征,让具身智能范式转变,还获融资并升级战略,在工业场景表现出色。
腾讯祭出开源核弹!LeVo音乐生成模型,媲美Suno,支持零样本风格迁移,歌词完美匹配
音乐生成领域有重大突破,腾讯AI Lab开源高保真音乐生成模型LeVo。它由LeLM和音乐编解码器组成,能解决现有方法在音质、音乐性等方面的局限,实验显示其优于现有方法,功能强大且适用场景多。
盛大AI研究院新作:流式生成超越非流式,一句话让虚拟人动作丝滑如真,推理延迟仅1帧
盛大AI研究院与东京大学联合提出FloodDiffusion,首个基于定制化扩散强制的流式人体动作生成框架。它能零延迟生成无限长动作序列,解决了现有方法的问题,在多数据集评估中表现优异。
从马斯克并购 Cursor 说起:国内编程智能体的牌桌、裂缝与全链自主之路
文章从马斯克600亿美元收购Cursor切入,分析海外编程智能体“垂直整合”趋势,指出护城河在全链掌控。对比国内,玩家分散,面临版权、安全等风险。强调中国须走全链自主之路,各层发力,目标是经略全球。
更少的token生成更好的图!香港大学联合阶跃星辰等让AI绘画真正理解了再画
香港大学、阶跃星辰等用VFMTok新方法,让图像生成模型借用顶级视觉AI的眼睛看世界,实现更快、高质量图像生成,且无需复杂引导技巧。它改变图像理解方式,将像素死记硬背转为语义理解。
狂肝一周,测评十余款 PPT AI 生成产品的真实反馈
评估 Agent 产品能力复杂,以 PPT 生成为例,有 Agent 和模板化两种流派。作者选前者投票测评、后者全方位测试。给出方案,还推荐不同需求适用产品,附总榜单和细致体验描述。
CVPR 2025 | 如何稳定且高效地生成个性化的多人图像?ID-Patch带来新解法
本文围绕个性化多人图像生成展开,指出其面临身份特征泄露等挑战。介绍了早期方法的不足,提出全新的ID-Patch方案,阐述其设计思路、实验效果等,还探讨了提升空间与未来方向,该方案在多人物图像生成中有突破式提升。
现在,你可以在手机上用AI生成一个APP了。
作者参加百度Create 2026 AI开发者大会,介绍百度秒哒。它是能帮开发产品的Agent,虽与顶级产品有差距,但全链路适配、对国内生态友好。大会上线APP版,能直接生成安装包,操作简单,解锁普通人创造力。
终于开源升级OmniGen2,统一多模态图像生成模型,真的惊艳。
OmniGen2是强大的开源统一多模态图像生成模型,针对文本和图像模态构建独立解码路径,运用未共享参数。新架构提升处理效率和质量,在图像编辑等任务表现出色,还有多技术特点。
从捍卫者到引路人,上交&上海AI Lab提出LEGION:不仅是AI图像伪造克星,还能反哺生成模型进化?
AIGC技术发展使AI图像滥用问题严重,公众面临信任危机。上交与上海AI Lab等团队在论文中从构建数据集、设计模型、实现检测与生成统一三方面破局,LEGION能检测伪造,还可反哺生成模型进化。