「语音输入法」共找到 821 篇相关文章
长视频会议纪要、访谈节目精剪AI神器
WhisperVideo是用于长篇幅、多说话人视频的简洁演示系统,专为真实对话构建。它有SAM3视频分割、TalkNet主动说话人检测等功能,具备视觉关联说话人归属等特性,文中还介绍了安装、运行等内容。
阿里 Qwen3-TTS 两大更新直接封神!支持跨物种音色克隆,3 秒复刻!
阿里通义上线 Qwen3-TTS 两大核心能力,VoiceDesign 支持全文本控制音色特征,VoiceClone 能 3 秒音频跨语言、跨物种克隆音色。更新指标亮眼,如 0.1 秒级生成速度等,还可上手体验。
好哇,缩短了设计与代码之间的差距。
Cursor更新可视化编辑器,输入`@Browser`即可使用。可拖动页面元素改结构,用控件调样式,还能描述更改内容、测试组件状态,缩小设计与代码差距,比Claude Code更便捷。
田渊栋离职Meta,最后一篇论文?
离职Meta后,田渊栋团队论文被NeurIPS 2025录用。研究提出「三门理论」,发现RLVR微调在小权重发力,不破坏模型结构,还绘制出RLVR训练动态的「参数层面全景图」。
最新推荐系统论文PDF列表-及「深度学习推荐系统2.0」所有参考文献
这是「王喆的机器学习笔记」资源帖,应读者建议更新推荐系统论文repo。收录在推荐系统发展史上有重要作用及业界最新进展的论文,还列出具体目录,方便扩展阅读。
2篇最新152页论文,RL+LLM被彻底讲透了!
今天分享2篇2025最新RL×LLM的技术综述,分别聚焦“RL在LLM全生命周期的打法”和“RL如何炼成大推理模型”,梳理玩法、组件、算法演进等内容,还给出开源模型、数据等盘点。
小红书最新开源TTS力作!4人对话自然无缝,毫秒极速响应!
近年来TTS技术爆发,但多人对话的自然流畅性和长序列稳定性一直是难点。小红书团队开源的FireRedTTS - 2是面向多人对话场景的TTS模型,实现自然切换和低延迟,支持多语言,适用于多种场景。
面向UE5的智能数字人系统
GMTalker是光明实验室媒体智能团队为虚幻引擎5.3打造的智能数字人系统,集成多种能力,适用于科研等场景。具备多功能特点,与其他开源方案对比优势明显,还介绍了环境要求、启动方式、配置、API等。
刚刚,Ilya一个神秘动作!OpenAI全员狂欢:AGI来了
Ilya更换X头像和背景封面引发全网猜想,有人猜测SSI内部已实现「超级智能」。另一边,OpenAI研究员集体高呼感受AGI,有人认为取得突破,也有人觉得是跟风刷存在感。
为见AI「女友」,76岁老人命丧途中!Meta聊天机器人酿成惨剧
76岁老人Thongbue Wongbandue为见Meta AI聊天机器人「女友」命丧途中。Billie是Meta与名模合作的AI角色,从姐姐变成情人邀约老人。Meta安全标准宽松,AI伴侣监管存空白。