电子书转有声读物」共找到 135 篇相关文章

算法论文7

基于离散扩散模型的高效音频修复方法

数字音频时代音频易损坏丢失,传统修复法处理长间隙不佳。本古里安大学研究人员提出基于离散扩散模型的音频修复法,经MusicNet数据集实验验证,该方法在各间隙长度上表现优异。

AIGC开放社区
开源动态7

比NotebookLM更好的「开源播客」,可根据多模态内容生成30分钟以上播客音频。

Podcastfy是开源Python工具,能把文本、图片等多模态内容,借生成式AI化为播客。它支持自定义,适配多种语言和文本语音模型,能生成2 - 5分钟或30分钟以上的播客,使用体验比NotebookLM好。

开源AI项目落地
推荐文章8

一篇讲透Agent自进化飞轮怎么搭:评测→记忆→落地→控制

文章指出多数团队评测、记忆、Self - Improve 拆分做,飞轮难,原因是环节衔接断链。基于行业研究及实践,提炼评测→记忆→落地→控制四齿飞轮方法论,阐述各环节核心矛盾、建设要点、避坑指南及咬合形成飞轮的方法。

腾讯技术工程
推荐文章7

Opus 4.5之后,AI正在催生“巨头型百人公司”

Opus 4.5发布后,Agent赛道洗牌,模型差距由Agent Loop拉开。本文围绕Cherry Studio,与创始人及投资人探讨AI公司护城河、开源意义、用户价值差异等,指出未来将催生“巨头型百人公司”。

五源资本 5Y Capital
产品应用8

把视频变成图文博客:Agent + 豆包 Seed2.0 lite 重做 Karpathy 两年前的工作流

本文以重做 Karpathy 两年前工作流为例,介绍用 Agent + 豆包 Seed2.0 lite 将视频为图文博客的方法。详述四步流程,指出其局限,还说明该模式可用于竞品直播追踪、在线课堂报告、游戏赛后复盘等场景。

宝玉AI
产品应用7

AI 驱动的多代理金融工作台

Vibe-Trading 是 AI 驱动的多代理金融工作台,能将自然语言请求化为交易策略等。它有自然语言策略、多数据源、专家团队等核心能力,具备面向交易的深度研究等功能,还介绍了安装方式、环境变量和推荐模型。

GitHubStore
新闻资讯8

人跑光了,AI视频炸了!马斯克狂发推:Grok Imagine三金封神

xAI的Grok Imagine在DesignArena视频排行榜上,拿下视频竞技场、图像视频和视频编辑三项第一,远超谷歌Veo 3.1、Sora等对手。它进步迅猛,靠聪明设计取胜,还将推动AI从“蛮力计算”向“智能理解”变。

新智元
新闻资讯7

9B 模型“平替”GPT-4o ?!面壁赌对OpenClaw端侧AI,内部上演一人月产65万行代码的效率核爆

2023年面壁智能攻端侧大模型,起初遭质疑,后获市场认可。今年发布开源全模态模型MiniCPM - o 4.5,年中还将推AI硬件松果派。其内部有“一人公司”趋势,对未来端侧智能发展有清晰判断。

AI前线
开源动态8

1.9K Star 微软开源TTS王炸!90分钟超长语音合成,4人对话自然切换!

在文本语音(TTS)领域,生成长篇、多说话人的高质量音频一直是技术挑战。微软最新开源的VibeVoice TTS模型,可一次生成90分钟连续语音,支持4个不同说话人,还具备高效处理长序列等亮点特性。

开源星探
新闻资讯7

4o-mini华人领队也离职了,这次不怪小扎

OpenAI的Kevin Lu离职,下一站是估值120亿美元的Thinking Machine Lab。他毕业于UC伯克利,在OpenAI领导完成4o - mini,擅长小模型和强化学习。他认为应关注互联网数据,停止强化学习研究做产品开发。

量子位