长文档处理」共找到 1723 篇相关文章

开源动态7

实时交互式视频生成

文章提出用于实时交互式视频生成的帧级自回归框架 LongLive,解决了视频生成在效率和质量方面的挑战,具备视频生成、实时推理、高效微调等亮点,还给出安装、推理、训练等步骤。

GitHubStore
开源动态8

多模态文本理解测评首发:46款模型无一攻克128K难关

香港科大等研究者联合提出MMLongBench,用于评估多模态模型文本理解能力。它覆盖5大类型任务的16个数据集,对46个模型测试显示,闭源和开源模型在上下文任务均面临挑战,OCR和跨模态检索能力是瓶颈。

量子位
算法论文8

Self-Forcing++:让自回归视频生成模型突破 4 分钟时极限

加州大学洛杉矶分校与字节Seed等团队联合完成Self-Forcing++,让自回归视频生成模型突破4分钟时极限。它解决传统模型架构缺陷,经三步技术实现稳定超视频生成,实验超基线,但仍有时记忆缺失等问题。

机器之心
开源动态8

边打字边出片,交互式生成视频!英伟达联合MIT开源新SOTA

AI拍视频不再难!英伟达联合MIT推出LongLive,可实时交互生成流畅画面,解决传统方法卡顿、不连贯等痛点。它能生成15秒到240秒视频,性能达SOTA,还靠三把“钥匙”解决、顺、快难题。

新智元
算法论文8

突破视频生成瓶颈:南大、TeleAI推出全新AI生成范式MMPL,让创意一镜到底

当前AI视频生成面临质量骤降、细节崩坏、生成低效等问题。南京大学联合TeleAI推出MMPL新范式,首创“宏观规划、微观执行”双层生成架构,实现分钟级高质量视频稳定生成,效率显著提升。

机器之心
产品应用8

大涨240%,Doc-Researcher确立多模态文档深度研究新范式

在ChatGPT引领的AI革命中,大语言模型面对专业复杂文档常“束手无策”。Doc-Researcher提出三位一体解决方案,构建M4DocBench评测,性能远超现有方案,还适用于多产业场景。

PaperAgent
产品应用8

面壁MiniCPM-V4.5新王炸!8B手机10FPS视频秒懂,文档手写全能识别!

面壁上新最强端侧多模态模型MiniCPM-V 4.5,基于Qwen3 - 8B与SigLIP2 - 400M构建,总参数量8B。它视觉语言理解强、手机能跑,有高帧率视频理解等特点,还有多方面技术亮点。

CourseAI
开源动态8

微软重磅开源!22K星的 VibeVoice 再添新成员,60分钟音频 ASR 端到端统一输出!

现在的 ASR 模型处理音频存在断章取义、说话人错乱等问题。微软开源 VibeVoice-ASR,可一次性处理 60 分钟音频,实现“三位一体”输出,补齐 VibeVoice 生态,还介绍了特点、架构、使用方法与应用场景。

开源星探
算法论文8

与DeepSeek-OCR不谋而合,NeurIPS论文提出让LLM像人一样读文本

NeurIPS 2025 论文提出 VIST 框架,为大语言模型文本推理提供视觉方案,与 DeepSeek - OCR 理念不谋而合。它模仿人类阅读,有快 - 慢路径协作,在多任务表现优,还让模型‘用眼看文字’,优势明显。

机器之心
开源动态8

面向时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni

文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。

GitHubStore