「文本转语音模型」共找到 7970 篇相关文章
32k微调处理百万Token:21倍的推理加速,10倍的峰值显存节省,实现恒定内存消耗
现有大模型处理超长文档易内存爆炸、计算崩溃。阿里巴巴未来生活实验室推出CoMeT架构,有双轨并行记忆系统,能恒定内存、线性时间处理文本,在基准测试超主流方法,实现21倍推理加速和10倍显存节省。
中美 NeoLab 对话:模型和 Agent 如何实现「持续学习」?
在新加坡 AGI Playground 2026 舞台上,AMI Labs 林敏和 Mind Lab Andrew Chen 深度对谈,探讨 Agent 如何将经验转化为能力、持续学习。两人对持续学习给出不同答案,还讨论记忆、学习等基础问题及解决办法。
OpenVision 2:大道至简的生成式预训练视觉编码器
多模态大模型浪潮中,视觉模块是关键。此前OpenVision训练管线复杂,成本高。研究者提出OpenVision 2,移除文本编码器与对比学习,引入随机丢弃视觉token技巧,性能佳且效率高,挑战了对比学习范式。
Claude: 可视化
文章指出早期人与人靠体力拉开差距,工业革命后比拼脑力,AI 时代脑力被大模型拿走,人将比较心力。面对 AI 生成的海量文本,可视化或为解决脑力理解带宽瓶颈的解药,还给出了相关 Prompt。
腾讯王者归来:混元图像3.0登顶LMArena!一手实测全球最强图像AI
LMArena最新榜单显示,腾讯「混元图像3.0」在文生图任务中夺冠,碾压谷歌Nano banana和字节Seedream 4。它9月28日开源,性能对标闭源模型,有强大推理、语义理解能力,支持中英文长文本渲染。
Karpathy:很多App就不该出生、人类唯一护城河只剩理解、CPU将沦为配角
在Sequoia Ascent峰会上,AI先驱Andrej Karpathy分享对2026年技术浪潮思考。他认为LLM是新物种,让部分旧软件多余,未来软件接口或为说明文本,还谈及模型能力不均匀性、创业机会、智能体经济及人类价值。
开源播客生成MoonCast:让AI播客告别"机械味",中英双语对话更自然!
MoonCast是革新性对话式语音合成模型,已开源。它借助LLM让剧本有干货与人味,采用全面规模化策略使音频合成更自然,性能在双语长对话播客上提升显著,接近真人播音效果。
AI助手Cici悄然霸榜海外,又是字节
AI智能助手领域有新玩家,字节跳动的Cici在多个国家应用商店霸榜,数月内下载量爆发式增长。它融合字节旗下技术,文本生成用到OpenAI、谷歌模型。同时,豆包在国内AI智能助手赛道全维度领先。
时隔六年,OpenAI 为什么再次开源?
OpenAI发布两款开源纯文本推理模型,时隔六年再次开源。其gpt - oss - 120b性能与o4 mini相当,成本降超10倍。此次开源有战略考量,或是为构建生态、吸引企业,也反映出其对自身价值定位更清晰。
无需训练,直接「算出」最强AI!理想汽车发现端侧Scaling Law
理想汽车基座模型MindVLA团队与国创决策智能技术研究所联合发布论文,提出面向端侧大语言模型的「硬件协同设计扩展定律」,解决大模型部署在端侧设备的难题,实现软硬协同设计,提升模型性能和研发效率。