「视觉语言融合」共找到 2042 篇相关文章
Qwen3-ASR的MLX原生实现:让SOTA语音识别跑满苹果芯片
Qwen3 - ASR是强大开源语音识别模型,但官方实现无法充分利用苹果芯片GPU能力。开发者完成MLX重写,让其能在苹果芯片上原生运行,实测性能佳,还有诸多核心功能及安装使用示例。
全球开源 AI 生态的未来:从 DeepSeek 到 AI+
这是关于中国开源社区自2025年1月‘DeepSeek时刻’以来进展的系列博客最后一篇,介绍中国AI企业和机构发展路径,展望开源未来方向,指出全方位开放共享成关键路径,‘有机生态’正成型。
阿里开源 Qwen3-TTS 全家桶!语音设计、克隆、生成全打包,开源 2 天 3K Star!
阿里通义团队开源 Qwen3 - TTS 全家桶,含语音设计、克隆、生成功能,开源 2 天获 3K + Star。它有秒级克隆、语音设计等能力,有 0.6B 和 1.7B 两种规格,双轨架构等技术创新保障性能。
包含一个 75+ AI 工程项目!所有内容100%开源
此 GitHub 仓库含 93+ 生产级 AI 项目,覆盖大语言模型、RAG、Agent 等主题。有不同难度项目及教程,适合各水平人士,还给出新手入门学习路径,采用 MIT 许可。
每周产业洞察 | AI浪潮奔涌,重铸3D影视产业新生态
北京AIGC视听产业创新中心位于朝阳区,是朝阳区推动影视制作基地建设的举措。由多方参与,首创郎园运营,提供六大服务平台,截至2025年8月汇聚60余家生态伙伴。首创郎园拓展服务边界,项目多地开花。
1.4K标星!微软开源了一款全能AI客服系统,一键24小时实时对话!
数字化时代传统呼叫中心问题多,成本高。微软在GitHub开源Call Center AI,基于Azure + GPT的智能语音客服系统,具多项功能,采用三层设计,适用多行业,可落地,或成企业标配。
Nano Banana 2突然现身!能画公式解数学题,监控画面都能伪造
Nano Banana 2代以预览版现身第三方网站,后被移除。其能力远超1代,能处理复杂提示,可生成复杂UI、解数学题甚至伪造监控画面。谷歌正将Nano Banana整合进核心产品生态。
大涨240%,Doc-Researcher确立多模态文档深度研究新范式
在ChatGPT引领的AI革命中,大语言模型面对专业复杂文档常“束手无策”。Doc-Researcher提出三位一体解决方案,构建M4DocBench评测,性能远超现有方案,还适用于多产业场景。
Claude封锁中国,腾讯带着国产AI编程工具CodeBuddy来了
Claude封锁中国背景下,国产代码模型加速发力。腾讯CodeBuddy上线,其IDE和CLI有新特性。InfoQ采访团队,探讨定位、技术等思考,国产模型与工具、生态形成“模型—工具—生态”链路。
狂揽15.9K star!!Win系统居然还有开源替代版,牛逼啊~
开源君分享开源项目`ReactOS`,它类似Windows,目标是与NT系列无缝兼容,可直接运行Windows软件和驱动。该项目始于1996年,在Github获15.9K star,有轻量、兼容等特点,安装简单。