「语言处理」共找到 1988 篇相关文章
Hugging Face开源nanoVLM,750行代码可训练视觉语言模型,简单到令人发指!
Hugging Face开源全新视觉语言模型框架nanoVLM,仅750行代码就能从零训练高效能VLM模型。它在单张H100 GPU训练6小时后,在MMStar数据集准确率达35.3%,且能在免费Google Colab跑。
PDF文件长出「AI大脑」?网友惊呼:这操作太「黑科技」了!
极客Aiden Bai将大语言模型塞进PDF,可让AI讲故事、聊天,Linux系统也能在其中运行。项目嵌入小型语言模型,如TinyStories、Pythia和TinyLLM,利用PDF支持的JavaScript实现,虽有局限但潜力大。
国内首篇!融合语言模型的多模态触觉传感器,推动机器人触觉迈向人类水平
清华大学丁文伯团队联合多机构,受鸽子感知机制启发研发仿生多模态触觉传感器 SuperTac,构建 8.5B 参数触觉语言模型 DOVE,成果发表于《Nature Sensors》,推动机器人触觉迈向人类水平。
85倍速度碾压:苹果开源FastVLM,能在iphone直接运行的视觉语言模型
苹果开源能在 iPhone 上运行的视觉语言模型 FastVLM,代码仓库含 iOS/macOS 演示应用。它速度快,首个 token 输出速度较同类模型提升 85 倍,还兼容主流 LLM,适合边缘设备等场景。
支持30种语言,多种中文方言 [四川话、粤语等]的颠覆性无分词器TTS系统
VoxCPM是无离散音频分词器的语音合成系统。VoxCPM2基于MiniCPM - 4构建,有20亿参数,支持30种语言和9种中文方言,具备音色设计、可控声音克隆等特性,还完全开源,商用就绪。
DPad: 扩散大语言模型的中庸之道,杜克大学陈怡然团队免训推理加速61倍
扩散大语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克大学陈怡然团队揭示其“草稿纸机制”,提出免训练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍推理加速。
上交大 × 华为小艺推出LoPA:7B扩散语言模型单样例1000+ tokens/s!
上海交通大学DENG Lab联合华为小艺团队提出无需训练的解码算法LoPA,配合自研的LoPA - Dist分布式推理系统,显著提升扩散大语言模型(dLLMs)的推理并行度和吞吐量,将推理效率推向新高度。
大语言模型(LLM)到底是怎么运作的?(配图通俗讲解)
文章先介绍条件概率,指出大语言模型预测下一个单词是条件概率问题,会计算所有可能单词的条件概率选最高的。还提到直接选最高概率会使内容单调,引出温度概念,它能调整概率分布影响抽样结果。
TDSQL Boundless:AI时代的多模态数据库
在AI与数据分析处理技术融合的当下,传统数据库架构面临诸多挑战。腾讯云TDSQL Boundless推出,通过统一架构处理多模态数据。本文从核心架构、关键技术特性及对未来数据平台建设的启示三方面解读。
大模型如何准确读懂图表?微软亚研院教它“看、动手、推理”
多模态大模型处理结构化图像有误差放大、推理难等问题。微软亚洲研究院等提出PixelCraft,以高保真图像处理与非线性多智能体推理为支柱,提升结构化图像理解性能,在多基准上有增益。