「应用截图生成」共找到 4066 篇相关文章
告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式
传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。
百亿向量,毫秒响应:清华研发团队向量数据库 VexDB 首发,攻克模型幻觉难题
9月25日,清华数智引航团队发布向量数据库VexDB,能支持百亿千维向量数据毫秒级查询,召回准确度超99%。它可解决大模型幻觉问题,已在多领域深度应用,为企业AI转型提供方案。
苹果出手!改进GRPO,让dLLM也能高效强化学习
苹果研究团队针对扩散语言模型(dLLM)在编码任务中表现不明的问题,基于7B级代码生成MDM DiffuCoder展开研究,定制优化GRPO提出coupled - GRPO算法,填补开源dLLM训练和推理机制空白。
安卓开发被Vibe Coding接管了?谷歌把搓App门槛彻底打下来,一周搓出25万个
谷歌近期状况不佳,不过 Google AI Studio 上线免费生成原生 Android App 功能挽回颜面。上线一周多创建超 25 万个 App,99% 以上用户此前未做过安卓开发,无需代码就能开发,还支持 Remix。实测显示效果不错。
刚刚,全球视频模型新王诞生了!
天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频生成从‘生成片段’走向完整视频生产,还应用于短剧平台DramaWave。
清华朱军团队Nature Machine Intelligence:多模态扩散模型实现心血管信号实时全面监测
清华朱军等团队提出多模态生成框架 UniCardio,在单扩散模型中实现心血管信号去噪、插补与跨模态生成。它采用扩散模型和 Transformer 架构,结合持续学习范式,实验表现优,有望用于多领域。
传统RAG只会翻书不会用?RAG+让Reasoning能力上一个新高度!
现有检索增强生成(RAG)技术在需复杂推理领域表现不佳,像只给菜谱不给实操演示。RAG+开创性新增“应用案例库”,与知识库构成双料库,在数学、法律、医疗场景测试中全面碾压传统方案,团队还透露了未来方向。
又来了!OpenAI 发布 Sora 2,同时推出 AI 版Tiktok
9月30日,OpenAI发布新一代视频生成模型Sora 2,相比Sora 1有显著提升。同时推出iOS社交应用Sora,类似TikTok。应用有安全措施,已在美加iOS平台邀测。社区反应两极分化,OpenAI野心大但或面临挑战。
Databricks × Snowflake 纷纷下注,PostgreSQL 成 AI 时代数据库标准?
文章结合作者对数据基础设施的实践与反思,探讨生成式AI时代数据系统的挑战与机遇。介绍数据基础设施新趋势,分析Neon、Supabase等公司受关注原因,指出PostgreSQL成行业标准,还提出Data Warebase概念及优势和应用场景。
产品经理起飞!Google AntiGravity升级Nano Banana Pro,AI编程真的牛逼了
作者用Google新发布的AntiGravity生成海报,其升级增加Nano Banana Pro能力后效果惊人。作者展示了用它生成高保真原型图、用户故事地图、用户旅程地图等案例,还提及更多应用场景及使用建议和限制。