文字转语音」共找到 471 篇相关文章

新闻资讯8

OpenAI推出GPT-5.4 mini/nano;MiniMax发布M2.7;小米发布MiMo-V2系列模型

OpenAI、MiniMax、小米陆续发布新模型。OpenAI推GPT - 5.4 mini与nano,优化速度和成本;MiniMax的M2.7能自我演化;小米MiMo - V2系列覆盖智能体核心、全模态理解和情感语音合成。

AIGC开放社区
新闻资讯7

ChatGPT和Claude争了个寂寞!用户重叠仅11%,中国应用霸榜移动端

风投机构a16z发布“迄今最受消费者喜爱的Top100 AI应用”榜单。前50个移动AI应用近半来自中国团队,用户多在海外。ChatGPT领先但挑战者来势汹汹,其与Claude用户重叠仅11%,全球形成三大AI市场。

量子位
产品应用8

pdf2skill:让计算机视觉初学者把PDF文档变成AI技能包

pdf2skill技术是“文档技能编译器”,能将PDF知识化为AI可调用技能包。它解决了计算机视觉研究和工程中的痛点,介绍了原理、实战案例、代码实现,还对比性能、给出使用指南。

机器学习AI算法工程
算法论文8

人脸机器人登上Science Robotics封面:用AI教会仿生人脸机器人「开口说话」

2026年1月15日,美国哥伦比亚大学工程学院研究登上《Science Robotics》封面,展示用AI让仿生人脸机器人“开口说话”技术。机器人经自监督学习,能将声音自然唇动,有跨语言泛化能力,助其跨越“恐怖谷”。

机器之心
算法论文8

SIGGRAPH Asia 2025最佳论文 | 港中大、曼彻斯特大学获奖

SIGGRAPH Asia 2025将“最佳论文奖”颁给港中大与曼彻斯特大学团队研究。该研究提出全新切片计算框架,把切片生成与路径规划化为数学优化问题,解决传统DLP 3D打印难题,还介绍了进阶策略和实验结果。

机器之心
算法论文8

LLM算力告急?把文本变图片,推理成本直接减半!

大型语言模型处理长文本时计算成本高,本论文探索‘文本即图像’输入压缩策略,将长文本渲染为图像输入多模态模型,可减少近一半令牌,且任务性能不受显著影响,在多任务中验证了其有效性。

深度学习自然语言处理
新闻资讯8

即时编程与设计,软件按需生成:Google生成式UI将重塑人机交互体验

Google Research团队发布生成式UI研究,打破Markdown文字墙模式,能将用户需求实时化为完整应用程序。系统通过多组件协作,构建不同风格界面,在多领域有应用案例,虽有挑战但前景好。

AIGC开放社区
算法论文8

与DeepSeek-OCR不谋而合,NeurIPS论文提出让LLM像人一样读长文本

NeurIPS 2025 论文提出 VIST 框架,为大语言模型长文本推理提供视觉方案,与 DeepSeek - OCR 理念不谋而合。它模仿人类阅读,有快 - 慢路径协作,在多任务表现优,还让模型‘用眼看文字’,优势明显。

机器之心
推荐文章7

从上下文工程到 AI Memory,本质上都是在「拟合」人类的认知方式

文章结合胡塞尔现象学,探讨从上下文工程到AI Memory,指出它们本质在‘拟合’人类认知。介绍二者概念及构建方法,对比人类与AI记忆异同,还通过与胡塞尔对话,思考AI意识等哲学问题。

Founder Park
推荐文章7

【访谈】在黑箱中寻找自我显影——对话苏仲尧|三影堂厦门

苏仲尧个展《打开黑箱说亮话》聚焦摄影人机互动,引向对‘技术黑箱’思考。创作分三阶段,从文字照片到金属板,再结合AI。他将创作主导权回归自身,借作品探讨技术与人关系及当下处境。

三影堂摄影艺术中心