说话人检测」共找到 1297 篇相关文章

开源动态8

3.2K Star!这个开源字幕神器,对剪视频的创作者来说,救了大命!

视频创作中字幕制作耗时费力,剪映等工具各有局限。开源字幕工具 AutoSubs 能有效解决痛点,可一键生成高质量字幕、自动区分说话,本地运行保障隐私,还具备多种亮点功能,使用简单。

开源星探
开源动态7

WhisperLiveKit:本地同步实时语音转文字

实时语音转文字难题待解,现有方案各有缺陷。WhisperLiveKit项目用前沿同步语音技术解决问题,支持多语言同步翻译、实时说话识别等,还介绍了安装、部署方式,不过效果受语言和模型等因素影响。

AI工程化
算法论文8

大模型幻觉检测新方法:实时高亮不确定内容

来自苏黎世联邦理工学院等机构团队,开发流式幻觉检测器,能在生成过程中即时标记幻觉实体。核心是识别具体“实体”是否虚构,实验表现出色,团队已将数据集和代码开源,有局限但应用前景好。

AI工程化
推荐文章7

公司创业,如何找对方法论、选准装备库?

AI让一做产品更易,全国一有限责任公司数量增长,相关服务生态成形。时踪由阿泰独立研发,从个痛点出发做出产品,其95%云服务选阿里云。阿里云为OPC创业者提供阶段化“装备库”。

AI前线
新闻资讯7

清北浙领跑两院新院士候选!最年轻被提名39岁

8月20日,中科院和工程院公布2025年院士增选有效候选名单。清北浙领跑,最年轻候选39岁。工智能地位提升,机器技术成优先支持学科,反映国家对新兴领域的重视。

量子位
开源动态8

猛涨25k star!一键检测你的电脑能跑哪些大模型!

最近 Github 出现工具 `LLMFit`,用 Rust 编写,能自动检测硬件配置,判断大模型能否流畅运行,推荐最优量化版本和运行模式。有一键硬件检测等特性,安装使用方便,降低本地部署门槛。

开源先锋
算法论文8

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

大视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国民大学与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活学安全模式,实验效果好且代码开源。

量子位
推荐文章7

一个Markdown就是一名员工!YC CEO给年轻的忠告:现在一个能顶400,大厂中层最该被AI替换

YC总裁Garry Tan在深度对谈中表示,传统SaaS模式或失效,个开发者效能因AI提升。他强调创业别追热点,应关注兴趣与独特知识,还指出大公司中层官僚体系未来可用Agents替代。

AI科技大本营
产品应用7

刚刚,为对抗哥大退学生开发的AI作弊器,哥大学生造了个AI照妖镜

Cluely是款备受争议的AI桌面助手,能替参会。哥伦比亚大学学生开发反Cluely工具Truely,检测通话是否为真。其原理是检测对方设备PID,不过使用较繁琐。同时,Cluely起诉公布其提示词的

机器之心
8

老罗数字爆火背后,百度做对了什么?

6月15日,罗永浩数字在百度电商直播超6小时,吸引超1300万次观看,带货破5500万元。它动作、语调等生动,能与弹幕互动。百度基于文心4.5T,从形、音、神让数字“神形音容”一致,还实现行业首次多数字同场及头部主播数字整场带货。

特工宇宙