「实时生成技术」共找到 4826 篇相关文章
一个指令误导智能模型!北航等首创3D语义攻击框架,成功率暴涨119%
北京航空航天大学与中关村实验室团队提出全新框架InSUR,入选NeurIPS 2025。该框架可基于指令生成对抗样本,首次实现3D SemanticAE生成,从采样、建模、评估三方面突破,实验验证其有效性与可扩展性。
生成式AI第二阶段:个性化AI助理 + AI Agent将颠覆我们的生活工作方式
生成式AI已迈入第二阶段,核心是能“动手办事”的AI智能体。未来AI以AI助理和AI代理形式存在,两者协同工作将带来工作方式革命,但面临记忆、信任、伦理等挑战。
实测惊艳全球的Veo3!音画同步无敌,贵是有原因的
谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。
RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑
北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。
ACL 2025预定爆款!HyperGraphRAG横扫5大领域,检索效率提升7倍
文章介绍HyperGraphRAG模型,它由知识超图构建、超图检索策略、超图引导的生成机制三部分组成。构建含知识超图构建、超图检索、生成机制等步骤,能提升检索效率与答案质量,或成ACL 2025爆款。
李飞飞团队新作:DiT不训练直接改架构,模型深度减半,质量还提高了
本文介绍「嫁接」技术,可在小计算预算下编辑预训练 DiTs 探索新架构。不从头训练,替换算子创建混合架构,保持质量同时减少计算量。还通过实验展示该技术在构建高效架构和文生图模型中的效果。
硅谷资深工程师:不止是 AI 产品,Coding 也需要好的 taste
硅谷资深工程师sean goedecke指出,技术品味与能力不同,其核心是为项目选适配工程价值观的能力。文章给出判断技术品味的方向,还阐述了好坏品味的识别方法及培养良好品味的建议。
语音界Sora!微软刚开源新模型,一次生成90分钟语音、3200倍压缩率
今天凌晨微软研究院开源创新音频模型VibeVoice - 1.5B,有诸多技术突破,如可合成90分钟语音、支持4名发言人、3200倍音频压缩等,还首创双tokenizer协同架构。未来微软还会开源更大参数模型。
微信技术架构部斩获CVPR 2025大赛冠军,攻克AI图文匹配评估难题
微信WXG技术架构部IH-VQA团队在CVPR2025大赛夺冠,首创iMatch图文匹配质量评估方案。文中介绍赛事背景、规则,团队通过双模型驱动等策略获胜,还构建iMatch-Benchmark评估主流T2I模型。
提示词一响,烂片登场,OpenAI谈下200+迪士尼顶级IP出场费
迪士尼官宣向OpenAI投资10亿美元,签三年合作协议,授权Sora用旗下200多个顶级IP生成短视频。此前好莱坞与AI版权纷争不断,如今迪士尼选择变现,但生成内容或影响其品牌形象。