「多模态生成对抗网络」共找到 2956 篇相关文章
AI研发新范式:基于技术方案全链路生成代码
文章指出过往代码补全方式存在局限,腾讯广告审核团队探索新AI开发范式。介绍业界AWS、Lovable范式,阐述审核团队实践范式,含定义、技术选型、过程标准化等,还提及进展、困难与未来展望。
数据蒸馏的双重突破:从几何保真到对抗鲁棒
深度学习中,数据集蒸馏可用精简合成样本替代庞大训练集且不牺牲模型性能,但面临精度和可靠性两大难题。两篇发表于 ICCV 2025 和 AAAI 2025 的论文分别给出解决方案,且代码已开源。
“一句话生成游戏”之后:2026 ChinaJoy的四个变化|甲子光年
AI给游戏产业带来新的生产技术,也引发了一场围绕游戏产业新价值链的争夺。本文介绍了2026 ChinaJoy现场正在发生的四个变化,包括游戏开发者的时间被重新分配、游戏引擎开始为Agent重新设计等。
AI+ Kuikly:7.5小时落地三端「多模态聊天 App」实战
腾讯开源的高性能跨端框架 Kuikly,搭配 AI 开发,仅用 7.5 小时交付一套支持 Android、iOS、鸿蒙三端的 AI 聊天 App。介绍了开发过程,包括环境准备、需求分析、编码实现、集成自测、迭代优化和验收复盘,展示了“AI + Kuikly”的高效。
Life of a Token:像调试代码一样看懂大模型如何生成 Token
文章类比 Chrome 的 Life of a Pixel,追踪 LLM 里 token 从输入到输出的全程。以 GPT - 2 Small 为例,详细讲解其管线各阶段,如 Tokenization、Embedding 等,还介绍了残差流、KV Cache 等概念及 GPU 性能瓶颈和优化方法。
Veo何止生成视频:DeepMind正在用它模拟整个机器人世界
通用型机器人策略发展带来挑战,传统评估方法有局限,前沿视频模型虽有潜力但面临困难。Google DeepMind团队提出基于Veo的机器人策略评估系统,经实验验证有效,展示了视频仿真评估的可行路径。
NVIDIA重磅开源!OmniVinci 仅 9B 模型就拿下多模态冠军!
英伟达推出全模态大语言模型 OmniVinci,架构有三大创新。OmniVinci - 9B 模型表现亮眼,多测试中大幅超 Qwen2.5 - Omni,且训练量仅为其六分之一。其架构经多阶段流程实现全模态理解,还支持多种功能。
阿里Qwen3一大波更新:代码生成、视频、图片、语音全都有
阿里Qwen3迎来一大波更新,涵盖多个模型。如Qwen3-Max在代码与智能体表现卓越;Qwen3-VL是强大视觉语言模型;Qwen3-Omni是全模态模型;还有图像编辑、同传、安全防护等模型及旅行规划师等应用。
为什么我坚决投入GEO(生成式引擎优化)?
AI改变流量分配规则,站长竞争焦点从‘排名位置’变为‘被引用率’,GEO应运而生。作者总结了GEO打法,如优化全站、关键页面,做结构化数据增强,还应用于自身产品。
深度长文AI一键生成:实测字节扣子空间新功能
文章实测字节扣子空间新功能,它自比「深度长文写作加速器」。从多方面考验,发现其一键总结方便,写论文、分析社会议题、创作抒情内容等各有表现,适合内容创作,但故事创作表现欠佳。