文档生成」共找到 2481 篇相关文章

推荐文章7

快手高欢深度解读:多模态理解如何成为AIGC视频生成的“幕后功臣”?

2024 年 AIGC 爆发,多模态理解技术支撑 AIGC 原生应用。快手高欢在 AICon 大会分享多模态理解在 AIGC 场景应用,介绍主流 AIGC 产品形态,探讨其背后多模态理解方法、提升能力途径及赋能 AIGC 的方向。

InfoQ
Product Application7

文档OCR新范式0.84 页/秒,吊打MinerU Qwen2.5VL

MonkeyOCR采用SRR三元组范式,简化多工具管道,避免整页文档处理低效率。与MinerU、Gemini 2.5 Pro等对比,性能表现优,处理速度达0.84页/秒,但对扫描件效果欠佳,架构含多模型,可通过特定地址测试。

CourseAI
算法论文8

攻克长文档与多模态挑战,Paper2Video实现学术视频的自动化生产

新加坡国立大学 Show Lab 团队主导研究,提出 Paper2Video 基准及评价指标,还推出 PaperTalker 多智体框架实现学术视频自动化生产,实验显示其在多方面表现佳,效果接近人工水平。

机器之心
算法论文8

CVPR 2026|AI开始会拍电影了:一分钟十镜头,全程不崩剧情

多镜头视频生成要求模型处理不同镜头间稳定信息和变化信息,现有方法有局限。Meta与哥本哈根大学研究者提出OneStory,建立跨镜头记忆机制,设计关键模块,实验表现好,为视频生成打开新可能。

机器之心
开源动态7

自动生成n8n工作流!这个神级开源方案,绝了~

文章分享全自动构建n8n工作流的方案,核心是开源项目n8n - mcp,它是AI Agent的n8n外挂知识库,能让AI深度理解和使用n8n。文中介绍其安装、使用,还展示不同难度案例的生成效果。

开源星探
开源动态8

AI加持的开源知识库新秀:PandaWiki,如何用它打造智能化文档系统?

PandaWiki 是长亭科技开发的 AI 大模型驱动的开源知识库搭建系统,能助力用户快速构建智能化文档系统。它有 AI 创作、问答、搜索等功能,安装简单,适用于多场景,优势明显。

小华同学ai
产品应用8

YOLO26(极速目标检测) + SAM3(精准掩码生成) 搭建一套实用的流水线

文章介绍用 YOLO26 极速目标检测和 SAM3 精准掩码生成搭建流水线。阐述二者原理,给出环境配置、实战代码,分析结果,还介绍进阶优化技巧和常见问题解决方案,适合实时应用场景。

机器学习AI算法工程
算法论文8

从「找视频」到「产视频」:快手RaG推动推荐系统迈向完全生成时代

快手最新论文提出的 Recommendation-as-Generation(RaG),把推荐系统从「在已有视频里找答案」推进到「根据用户兴趣生成答案」,已在快手大规模广告系统中部署,带来广告收入提升。

机器之心
开源动态8

14.9k Star!Firecrawl 开源的 PDF 智能分类器,200 份文档 0.47 秒搞定!

Firecrawl 开源 PDF 智能分类与文本提取库 pdf-inspector,已获超 1.4 万人标星。它能智能分类、感知提取、转 Markdown 及按需路由,性能炸裂,分类快,多项指标领先,还支持多平台。

开源星探
开源动态8

社区供稿 | VibeVoice实现90分钟、多角色播客生成,拓展语音合成新边界

微软亚洲研究院提出全新语音生成模型 VibeVoice,采用 next - token diffusion 机制,能将文字脚本转为最长 90 分钟、最多 4 人对话的高质量播客音频,在多方面有显著优势,未来潜力大。

Hugging Face