产品应用7
美团推出音频驱动框架LLIA
带你学AI
AI 摘要
美团:推出音频驱动肖像视频生成框架LLIA,有四项核心技术与三大核心模块。构建大数据集,能实现低延迟、流畅且逼真的双向交互,为多媒体生成场景开辟新可能。
阅读原文 · 带你学AI
低延时、可交互的音频驱动肖像视频生成框架LLIA
美团提出新型音频驱动肖像视频生成框架LLIA,是低延迟、可实时交互的虚拟形象生成技术。它提出四项核心技术,引入三大核心模块,构建超100小时数据集,在多方面有出色表现。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
复旦&引望WAM-Diff2让自动驾驶解码提速15.1倍
视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。
机器之心
新闻资讯7
美团与OpenClaw之父谈AI转型与开源项目
今年2 - 3月美团开展“养虾运动”,引入OpenClaw,日耗上千万元还干扰经营。美团CEO王莆中复盘称这是AI转型第一阶段。OpenClaw之父Peter也复盘爆火8个月经历,分享经验与感悟。
InfoQ
算法论文8
字节团队发现文生图Scaling新变量
ByteDance Seed团队研究发现,文生图模型中自然语言Caption变长,不意味着模型获更多视觉监督,其信息量更能预测训练损失。团队提出Structured Prompt,从两侧提升文本条件,在多任务上取得显著提升。
机器之心
新闻资讯8
ICML 2026:扩散模型与AI安全引关注
ICML 2026大奖公布,杰出论文奖中两篇扩散模型论文获奖,立场论文奖指出AI安全工具被挪用问题。时间检验奖颁给DeepMind经典论文。获奖名单显示扩散模型研究热,AI安全需审视,AI研究进入深度清理阶段。
新智元