「音视频同出大模型」共找到 8185 篇相关文章
CapCut Mate:开源剪映自动化神器,让AI替你剪视频!
CapCut Mate是开源免费的剪映草稿自动化助手,让开发者通过API控制剪映核心功能,效率提升超100倍。它功能丰富,覆盖剪辑全流程,适用于多场景,还提供三种使用方式。
FriendliAI获2000万美元,以加速AI模型推理工作负载
专注AI推理的初创平台FriendliAI获2000万美元种子扩展轮融资,资金用于加速平台开发。其专有推理优化技术可降低模型运行成本和能耗,能为用户省90%的GPU成本,合作客户广泛。
大模型Agent的下一阶段:可自我进化的AI-Agent
在人工智能飞速发展下,研究者探索让AI自我反思改进。本文作者构建自我进化AI智能体系统,设计四层渐进式架构,经《卡坦岛》实验,证明自我进化能力,不同模型表现有差异,代码级进化潜力惊人。
本地可运行的高质量的文本转语音模型
介绍Kyutai的Pocket TTS,一款轻量级文本转语音应用,可在CPU高效运行,模型小且低延迟,支持Python API和CLI,能语音克隆,还可在浏览器试用,目前仅支持英语,也有社区浏览器端实现。
DeepMind 发布超真实世界模型 Genie 3,AGI 向前一步
谷歌旗下DeepMind发布通用型世界模型Genie 3,可通过文本提示生成动态世界并实时交互,其生成内容物理一致性达分钟级。它功能丰富,也受业内好评,但有行动空间有限等局限,对迈向AGI意义重大。
好你个智谱,模型价格搞双标:中国一套外国一套
网友发现智谱Max计划国内外价格差异大,中国469元(约68美元),西方160美元,引发热议。Hugging Face产品负责人力挺GLM - 5.1,而Claude被曝性能下滑、成本增加。
Qwen开源版Banana来了!原生支持ControlNet
Qwen推出新图像编辑模型Qwen - Image - Edit - 2509,支持多图融合、增强单图一致性,原生支持ControlNet。还开源端到端全模态模型Qwen3 - omni,性能优异,功能丰富。
AI Infra入门干货总结:大模型是如何高效推理的
作者深入研读vLLM源码,以Llama 3为例,聚焦Decoder-Only架构LLM,介绍推理各环节及张量维度变化,讲解连续批处理和Paged Attention概念,还阐述推理流程、采样策略等,最后总结相关拓展内容。
Google新研究:降低大模型幻觉的全新视角——充分上下文!
谷歌新研究《SUFFICIENT CONTEXT: A NEW LENS ON RETRIEVAL AUGMENTED GENERATION SYSTEMS》提出“充分上下文”概念,剖析RAG系统失败原因并给出解决方案,对提升企业AI准确性和可靠性有重要意义。
这个开源项目把视频处理与投稿接成一条流水线
Y2A-Auto是面向YouTube、AcFun和bilibili的自动化处理工具,将下载、识别、翻译等操作集成到Web管理后台。用户可手动或自动处理,支持多平台投稿,有多种功能和灵活配置,适合持续处理授权内容的用户。