开源TTS模型」共找到 8855 篇相关文章

算法论文8

模型“拼好题”,45K数据撬动18%提升,数学问题拒绝死记硬背 | MathFusion

上海AI Lab等团队提出MathFusion,通过三种“融合策略”生成新的融合数据集MathFusionQA,仅用45K合成指令,在多基准测试中平均准确率提升18.0个百分点,增强模型解决数学问题的能力。

量子位
开源动态8

中国具身模型狂揽全球第一!机器人的人类数据时代来了

00后带队的灵初智能用近10万小时人类数据拆解具身智能,1000小时数据开源。其发布Psi-R2和Psi-W0双系统架构,让Psi-R2登顶MolmoSpace榜单。灵初认为纯人类数据训练必要,还强调开源对具身智能落地重要。

量子位
新闻资讯8

炸裂!谷歌I/O大会王者归来:Gemini“世界模型” 初现,搜索“换脑”,一句话制作原声电影

谷歌I/O 2025大会发布大量技术,虽Gemini 2.5 Ultra未到,但Pro有革新。还推出新模型、代理工具,多模态能力提升,搜索重塑,加入AI眼镜开发,倾尽全力发展AI生态。

AI寒武纪
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。

深度学习自然语言处理
开源动态7

一周1.2k星!兼具质量与效率的OCR模型MonkeyOCR,支持多样化的中英文PDF

MonkeyOCR采用SRR三元组范式,简化多工具流程、避免整页文档处理低效问题。与MinerU、端到端模型相比性能更优,处理速度也更快。暂不支持拍摄文档解析,文章还给出安装、推理等操作步骤。

GitHubStore
产品应用8

交大系杀出具身赛道重围!1万台订单在手,以世界模型重塑万亿城市基建

物理AI成新征途,通用机器人面临工程难题。酷哇科技发布COOWA WAM 2.0世界模型,实现范式升级。其有四大技术支柱,助力机器人发展。酷哇预计2026年交付超万台机器人,还构想了“Robo City”图景。

量子位
产品应用8

刚刚,蝉联Future X全球榜首的MiroMind发布全球最强搜索智能体模型

由陈天桥和代季峰联合发起的 MiroMind 团队,于 1 月 5 日发布自研旗舰搜索智能体模型 MiroThinker 1.5。该模型参数规模小但性能强,其核心是「发现式智能」理念,还采用了新训练技术,有 A 股涨停板预测等应用。

机器之心
开源动态8

第二代InfLLM开源,同尺寸快三倍!零参数,可训练稀疏注意力

新智元报道,清华、OpenBMB和哈工大提出零额外参数、训练高效的原生稀疏注意力框架InfLLM-V2,仅用5B长文本词元就能完成训练,相比稠密注意力机制有显著加速,性能接近传统稠密模型

新智元
算法论文7

Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。

机器之心
开源动态8

苹果端侧AI两连发!模型体积减半、首字延迟降85倍,iPhone离线秒用

苹果在Hugging Face放出FastVLM与MobileCLIP2两条多模态主线。前者主打「快」,首字延迟压到竞品1/85;后者突出「轻」,体积减半。模型和Demo已开放,开发者可集成开发。

新智元