语音时长控制」共找到 1318 篇相关文章

开源动态8

Meta开源史上最强语音“基座模型”:一口气支持1600+种语言

Meta AI FAIR团队发布Omnilingual ASR模型套件,能为超1600种语言提供自动语音识别能力。它引入新架构提升性能,改变引入新语言范式,还发布相关数据集和模型,与全球伙伴合作。

AI寒武纪
开源动态8

吴恩达推出 Context Hub,专治 AI 写代码的「瞎编」问题

吴恩达推出开源工具 Context Hub,解决 AI 写代码的「API 幻觉」问题。它通过喂最新文档,让 Agent 按需取用,还能做批注。与 MCP 路线工具不同,它按需拉文档,且引入反馈机制更新文档。

AGI Hunt
推荐文章8

TileLang vs Triton 详解:谁该握住控制面——编译器还是开发者?

文章对比 TileLang 与 Triton 两个框架,解释控制面设计、并发协议、编译管线的本质差异,以及这些差异如何影响性能上限、工程投入。明确 TileLang 追求榨干内核,性能上限高但对开发者要求高;Triton 追求快速落地,生态成熟。

GiantPandaLLM
新闻资讯7

当未经检查的自动扩缩造成 12 万美元的云支出

Reddit 上一个云成本恐怖故事引发热议,一集群遭 DDoS 攻击自动扩展,72 小产生 12 万美元账单。Zero Cloud Waste 创始人给出预防措施,各方也发表看法,凸显需 FinOps 战略配合自动扩缩。

InfoQ
新闻资讯7

突发!OpenAI 宣布重大调整:非营利组织将继续永久控制公司!

OpenAI宣布重大结构调整,包括继续由非营利组织控制、营利实体变为公益企业等。网友对此看法不一,有人认为是为赚钱囤资本,也有人肯定其能兼顾使命与发展,变革影响待察。

AGI Hunt
开源动态8

Meta开源多语言语音识别系统,支持1600种语言,可轻松扩展新语种!

Meta研究团队开源Omnilingual ASR,能理解1600种语言,用几条语音 - 文本配对样本就能零样本扩展新语种。提供三种架构,满足不同需求,性能超现有多语种模型,应用场景广泛。

开源星探
算法论文8

行业新突破:行为基础模型可实现高效的人形机器人全身控制

该综述聚焦行为基础模型(BFM)在人形机器人全身控制中的应用,梳理进展并分类算法,介绍应用与限制,还探讨未来研究机会与风险,有望引导该领域研究者和从业者。

机器之心
算法论文8

突破具身智能“专家困境”!北大新方法让宇树G1靠单一框架掌握跳舞和侧手翻

北京大学与BeingBeyond团队联合研发的BumbleBee系统,用创新的‘分治 - 精炼 - 融合’三级架构,实现人形机器人在多样化动作中的稳定控制,破解传统控制策略的‘专家困境’与‘现实鸿沟’。

量子位
产品应用7

Harness Monitor:当多个 Agent 同写代码,如何看住质量

作者在有了 OpenAI 赞助的 Codex Pro 后,让多个 Agent 同在一个代码库工作。他开发的 Harness Monitor 从 Git 视角出发,解决多 Agent 写代码的质量问题,涉及观察、治理等多方面能力。

phodal
开源动态8

Qwen3-ASR的MLX原生实现:让SOTA语音识别跑满苹果芯片

Qwen3 - ASR是强大开源语音识别模型,但官方实现无法充分利用苹果芯片GPU能力。开发者完成MLX重写,让其能在苹果芯片上原生运行,实测性能佳,还有诸多核心功能及安装使用示例。

AI工程化