「有声书转换」共找到 202 篇相关文章
传统RAG只会翻书不会用?RAG+让Reasoning能力上一个新高度!
现有检索增强生成(RAG)技术在需复杂推理领域表现不佳,像只给菜谱不给实操演示。RAG+开创性新增“应用案例库”,与知识库构成双料库,在数学、法律、医疗场景测试中全面碾压传统方案,团队还透露了未来方向。
阿里刚刚开源了一款影视级配音项目,口型同步、音色转换都不是事!
阿里通义实验室语音团队联合中科大发布多模态电影配音模型Fun - CineForge,开源模型并构建中文电视剧配音数据集。它能处理多种场景,有视频理解等亮点,还给出制作数据集步骤。
租了个AI程序员,9秒把公司数据库当bug修掉了,还写下认罪书
一家为租车企业提供运营软件的 SaaS 公司,因 AI 编程 Agent 自作主张,9 秒内抹除生产数据库。创始人指责 Cursor 与 Railway,前者防护机制未起作用,后者备份机制有问题,最终小企业为事故买单。
火线解析MiniMax招股书!全球领先大模型成本只有OpenAI 1%,果然拳怕少壮
上海大模型独角兽MiniMax通过港交所聆讯冲刺IPO。它是全球化AGI科技公司,全模态能力领先且成本低。技术上各模态模型表现出色,采用“模型即产品”模式获客,财务业绩向好,团队年轻高效。
读万卷书,大模型就能「看」懂视觉世界?Meta揭秘LLM视觉先验的起源
Meta超级智能实验室与牛津团队新论文发现,只见过文本的大语言模型(LLM)能学到可迁移到视觉任务的先验能力。研究通过超100组受控实验、耗费50万GPU小时,揭开LLM视觉先验来源,还给出预训练数据配方。
小红书发布FireRedChat:首个可私有化部署的全双工大模型语音交互系统
小红书智创音频团队推出业内首个支持私有化部署的全双工大模型语音交互系统FireRedChat,可将半双工链路升级为全双工,提供级联与半级联服务,在多指标领先,让AI有“人感”。
动动嘴,AI自己打开小红书、高德地图帮你干活了,国产Agent深度体验
作者为测试AutoGLM能否提高AHPU,用两个实测案例展示其功能,还拆解产品技术,介绍其进化历程。AutoGLM虽有不足,但已接近作者期待的产品形态,未来有望持续进化。
近500页史上最全扩散模型修炼宝典,宋飏等人一书覆盖三大主流视角
宋飏等人所著《The Principles of Diffusion Models》共460多页,系统梳理扩散模型发展脉络与核心思想,以统一数学框架串联多种视角,是研究者参考资料与初学者入门读物。
当万相2.5刚开卷有声视频,7月已经发布音频一体化的百度蒸汽机又开卷长视频了
百度升级MuseSteamer蒸汽机视频生成模型,可生成任意长度视频,生成中能更新prompt交互创作。其技术规划前瞻体系化,成本低,在多行业有应用和商业化空间。
抖音、视频号、小红书、公众号、百家号、网站、DeepSeek AI等SEO排名关键词布局怎么做?【收藏】
白杨SEO分享多平台SEO排名关键词布局方法。先讲核心步骤,包括确定主题、做话题树、定优先级和内容类型,后详细介绍抖音、视频号等7个平台的关键词布局具体做法。