「视觉生成模型」共找到 8881 篇相关文章
本地可运行的高质量的文本转语音模型
介绍Kyutai的Pocket TTS,一款轻量级文本转语音应用,可在CPU高效运行,模型小且低延迟,支持Python API和CLI,能语音克隆,还可在浏览器试用,目前仅支持英语,也有社区浏览器端实现。
阿里、南开大学发布免训练,视频大模型创新压缩方法
视频模型序列化处理影响推理速度与扩展性,传统token压缩方法在视频理解中有问题。阿里通义实验室与南开联合发布LLaVA - Scissor,用SCC方法和两步时空压缩策略,实验显示其性能优于其他方法。
南京艺术学院人工智能与计算机视觉算法创新设计成果展示
南京艺术学院‘人工智能与计算机视觉算法创新设计工作坊’汇集师生与专家成果,涵盖多种艺术形式。学生学习多技术完成跨媒体作品,如以《大闹天宫》为蓝本的交互装置,还有探索情绪、文化等主题的作品。
SceneWeaver:面向通用三维环境生成的反思型智能体框架
室内场景合成在具身智能兴起下愈发重要,现有方法存在局限。BIGAI提出SceneWeaver框架,通过基于工具的迭代优化统一多样场景合成范式,具有高保真模拟、强健物理交互等优势。
好你个智谱,模型价格搞双标:中国一套外国一套
网友发现智谱Max计划国内外价格差异大,中国469元(约68美元),西方160美元,引发热议。Hugging Face产品负责人力挺GLM - 5.1,而Claude被曝性能下滑、成本增加。
Qwen开源版Banana来了!原生支持ControlNet
Qwen推出新图像编辑模型Qwen - Image - Edit - 2509,支持多图融合、增强单图一致性,原生支持ControlNet。还开源端到端全模态模型Qwen3 - omni,性能优异,功能丰富。
AI Infra入门干货总结:大模型是如何高效推理的
作者深入研读vLLM源码,以Llama 3为例,聚焦Decoder-Only架构LLM,介绍推理各环节及张量维度变化,讲解连续批处理和Paged Attention概念,还阐述推理流程、采样策略等,最后总结相关拓展内容。
11.8k Star 爆火!Firecrawl开源王炸,秒级生成React应用!
知名网页抓取工具Firecrawl团队推出开源项目Open Lovable,几天内获11.8k Star。它是AI网页克隆工具,能秒级将网站克隆为React应用,功能丰富,适合多类人群,还介绍了上手步骤和应用场景。
Nature发布Delphi-2M模型,提前20年预测你得什么病
2025年9月17日《自然》发表研究成果,欧洲、德国和丹麦科学家改造GPT架构,推出Delphi - 2M模型。它能预测1258种疾病及死亡风险,依据过往病史等提供风险概率,虽有局限但潜力大。
从Foundation Model到Physical AI,三星「杀入」大模型核心战场
三星正快速进入大模型核心战场,构建Foundation Model体系,采购GPU用于AI基建。它提出Meki架构、M2RL训练范式和LiveClawBench评测体系,由AI Model TF团队推进,负责人是唐业辉。