「开源语音模型」共找到 8889 篇相关文章
估值 7 亿美元的 AI 语音输入产品:语音输入的关键问题是听写,不是转录
AI语音输入产品Wispr Flow发展迅猛,ARR 5个月翻10倍,公司估值超7亿美元。其创始人Tanay Kothari认为,该产品与其他同类最大区别是理解用户意图,解决听写而非转录问题,还分享了产品特点等内容。
AI秒懂短视频,快手大模型Keye-VL理解力爆表!技术细节全开源
快手全新多模态大语言模型Kwai Keye-VL上线且开源,能深度融合多模态信息,在视频理解、复杂视觉感知和逻辑推理上表现优异。介绍了其技术架构、预训练和后训练策略及训练架构优化等内容。
让视觉语言模型像o3一样动手搜索、写代码!Visual ARFT实现多模态智能体能力
上海交大等团队推出多模态智能体训练方法 Visual-ARFT,让视觉语言模型有「工具智能体」能力,还开源项目。它能自动调用工具、拆解任务,团队构建 MAT-Bench 评测,其在多任务超 GPT-4o。
颜水成领衔,给AI分段位!超100款多模态模型,无人达到L5
十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。
这个开源工具让AI理解你正在操作的任何界面,俩学生辍学开发的产品,功能超多。
Everywhere是两个学生辍学开发的开源交互式AI助手,能感知屏幕内容,在任意界面使用。它功能多、细节优,支持多场景,集成多种AI模型,使用简单,还提供个性化体验。
蚂蚁具身研究首次亮相!就解决了机器人「看」透明玻璃这些难题,还开源了
蚂蚁灵波科技开源高精度空间感知模型 LingBot-Depth,针对性解决机器人识别真实世界的「玻璃问题」。其构建双线并行数据集,提出掩码深度建模思路,在深度补全等任务中表现出色,且已具备落地能力。
重新定义检索!一款真正“跨模态”的 RAG 模型来了!用音频搜视频、文本找音乐!
传统RAG有速度慢、细节丢失等问题。Vidore开源的ColQwen - Omni 3B多模态RAG模型,支持跨模态检索,能直接处理音视频原始数据,保留细节,检索速度快,还具备轻量高效等特性,适用于多场景。
你那上万行Agent代码都是垃圾!Browser Use作者骑脸输出,开源了Manus级内核。
Browser Use作者Gregor Zunic称上万行Agent代码是垃圾,提前开源驱动BU.app的Agent内核。其核心仅一个for循环,理念是价值在模型非代码,还介绍三大支柱,使用方便,项目大道至简。
Jina Code Embeddings: 为高质量代码搜索而生的0.5B/1.5B向量模型
本文介绍了 Jina AI 开源的代码向量模型 `jina-code-embeddings`,含 0.5B 和 1.5B 规模,有 GGUF 量化版本。它性能顶尖,支持多任务与 15 种语言,还介绍了训练方案、使用方法等。
一天斩获2.5k星星!首个可以「让AI直接画CAD」的开源项目来了
新开源项目text - to - cad很猛,只需把需求告诉AI,它就能生成可编辑3D模型、导出文件,还能预检。支持多格式,有几何引用等特点,一天获2.5k星。