长文本处理」共找到 1800 篇相关文章

开源动态7

实时交互式视频生成

文章提出用于实时交互式视频生成的帧级自回归框架 LongLive,解决了视频生成在效率和质量方面的挑战,具备视频生成、实时推理、高效微调等亮点,还给出安装、推理、训练等步骤。

GitHubStore
算法论文8

Self-Forcing++:让自回归视频生成模型突破 4 分钟时极限

加州大学洛杉矶分校与字节Seed等团队联合完成Self-Forcing++,让自回归视频生成模型突破4分钟时极限。它解决传统模型架构缺陷,经三步技术实现稳定超视频生成,实验超基线,但仍有时记忆缺失等问题。

机器之心
产品应用8

Google Gemini Embedding2:一个模型处理所有媒体类型

Google发布Gemini Embedding 2,首个原生多模态嵌入模型。能处理文本、图像等多种媒体类型,支持交错输入,覆盖超100种语言。与多模型串联方案比,延迟降70%、召回率升20%。已可在Gemini API等使用。

AI工程化
开源动态8

边打字边出片,交互式生成视频!英伟达联合MIT开源新SOTA

AI拍视频不再难!英伟达联合MIT推出LongLive,可实时交互生成流畅画面,解决传统方法卡顿、不连贯等痛点。它能生成15秒到240秒视频,性能达SOTA,还靠三把“钥匙”解决、顺、快难题。

新智元
开源动态8

LLM文本内卷,谁是真英雄?告别跑分玄学,我们需要一把“公道秤”

OpenNLG Group做了统一上下文评估框架LOOM - Scope,兼容主流benchmark、model和上下文加速方法。该框架围绕BENCHMARK、DEPLOYMENT和EVALUATOR三大核心模块,还提出LOOM - Bench应对评估成本制约。

深度学习自然语言处理
算法论文8

突破视频生成瓶颈:南大、TeleAI推出全新AI生成范式MMPL,让创意一镜到底

当前AI视频生成面临质量骤降、细节崩坏、生成低效等问题。南京大学联合TeleAI推出MMPL新范式,首创“宏观规划、微观执行”双层生成架构,实现分钟级高质量视频稳定生成,效率显著提升。

机器之心
开源动态8

让机器人「秒懂人话」!中国电信TeleAI发布首个实时文本驱动人形机器人控制框架TextOp

中国电信人工智能研究院(TeleAI)具身智能团队推出人形机器人TextOp通用小脑,首创流式文本驱动的实时小脑控制范式。用户发文本指令,机器人就能实时理解、无缝切换动作,在多场景有应用潜力。

机器之心
开源动态8

颠覆传统向量数据库,直接将文本数据编码成视频文件,轻量级革命性的大规模AI记忆解决方案Memvid

Memvid将文本数据编码为视频,改变AI记忆管理,实现百万级文本块闪电语义搜索和亚秒级检索。它存储高效、轻量级、可离线,应用场景广,还给出安装、使用、配置等说明,并与传统方案对比。

GitHubStore
算法论文8

TACL 综述 | 别只卷架构了——文本模型的能力天花板,其实是数据决定的

该 TACL 综述首次从数据视角审视上下文语言模型,指出上下文能力本质是数据驱动。它建立分类体系,明确高质量文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。

深度学习自然语言处理
开源动态8

微软重磅开源!22K星的 VibeVoice 再添新成员,60分钟音频 ASR 端到端统一输出!

现在的 ASR 模型处理音频存在断章取义、说话人错乱等问题。微软开源 VibeVoice-ASR,可一次性处理 60 分钟音频,实现“三位一体”输出,补齐 VibeVoice 生态,还介绍了特点、架构、使用方法与应用场景。

开源星探