说话人识别」共找到 1347 篇相关文章

新闻资讯7

比iPhone更疯狂!乔布斯去世15年后,「最像他的」操刀首款AI硬件

2026年1月,OpenAI首款硬件“Sweetpea”路线图泄露,9月将发布。其形似“蛋石”充电盒内藏耳后设备,搭载顶级芯片,成本高。Jony Ive操刀设计,目标取代iPhone,OpenAI首年计划产销4000 - 5000万台。

新智元
新闻资讯7

星海图创始高继扬:具身智能三层技术路线,没有捷径可走

星海图在第一届全球开发者大会上,展示了其在具身智能领域的战略布局。提出100万小时超高质量真实数据计划,发布新一代VLA基础模型G0.5并开源,还联合发布创业孵化项目「星途计划」,探索三段式商业模式。

量子位
推荐文章7

为什么你的"AI 优先"战略可能大错特错?

文章指出与其说AI First,不如说软件工程First。AI时代成了瓶颈,应把从链条拿掉。但实施AI First需满足自动化测试、CI/CD流程等条件,且只适合部分场景。还介绍了相关技术栈、功能开发和修复路径及成果。

宝玉AI
产品应用7

Vibe Coding 有了,Vibe Design 呢?Lovart 让不会设计的也能输出专业素材

作者用 AI 编程一年多,但标签页表情包提醒自己不是设计师。现有生图工具生成的 PNG 不能直接当 logo 用,而 Lovart 打通从 PNG 到 SVG 的路,让无设计知识的也能输出专业素材。

AI产品自由
产品应用8

OpenAI 发了一份《写好文档指南》|写文档,是一种同理心的体现

OpenAI发布《写好文档指南》,强调写文档是为把信息装进别脑子,是同理心的体现。给出让能扫、好读、更多看懂等原则,如拆分内容、句子简洁等,还指出必要时可打破规则。

AI进修生
开源动态8

1B参数,0.21秒识别,0.3%错字率:混元OCR拿下7项SOTA

腾讯开源模型 HunyuanOCR 在权威榜单 OmniDocBench 上霸榜,虽仅 1B 参数,却在 7 项任务击败众多大模型。它解决传统 OCR 流水线及通用大模型痛点,通过独特架构和训练方法实现高效准确识别

CourseAI
推荐文章7

Claude Code之父最新判断:AI时代团队分工被重写,这「五种」最吃香

近日,Anthropic Claude Code 团队负责 Boris Cherny 提出,随着职能融合,团队传统岗位标签将被 5 类新型角色取代,且成员角色不固定,需随项目变化,此观点引网友热议。

机器之心
产品应用7

DeepSeek识图模式全量上线,却认不出自家老板梁文锋

端午节前,DeepSeek全量推送识图模式。测试发现,它能认出黄仁勋,但忽略‘豆汁’字样,识别物和潦草汉字准确率低,不过识别文物能力不错。还比较了与其他模型在乐理推理测试中的表现,开发者有新疑问待解答。

机器之心
新闻资讯7

最具争议的 1 AI 公司融了 3000 万美金,估值达到了 2.5 亿

1AI公司Polsia引发大量质疑,有认为它是“垃圾产品”,指出其ARR统计、客户流失率等问题。但它刚完成3000万美金融资,估值达2.5亿美金,网站月流量超100万。

投资实习所
开源动态8

阿里重磅开源 0.5B TTS + 0.8B ASR,支持跨语种音色克隆、说唱识别

2025 年 AI 圈风向变了,开始卷端侧模型。阿里 FunAudioLLM 团队发布 Fun - CosyVoice3 0.5B 和 Fun - ASR - Nano 0.8B,TTS、ASR 双线程开源,是工程级版本,目标是在本地跑顺‘听 + 说’。

开源星探