视频字幕处理」共找到 1875 篇相关文章

推荐文章8

使用 Claude Code 自动化 GitHub Actions

这篇技术博客介绍用Claude Code自动化GitHub Actions Runner镜像更新工作,包括用其处理补丁冲突、分析变更,以减少人工工作量,提升开发者生产力,还给出实现细节与代码。

AGI Hunt
算法论文7

ICLR 2025新成果:文档检索“降本增效”,从此“开挂”

传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展到图文+音频多模态匹配。

CourseAI
算法论文8

ICML 2025 Spotlight|南洋理工陶大程教授团队等提出基于RAG的高分辨率图像感知框架,准确率提高20%

南洋理工陶大程教授团队等合作,为解决多模态大语言模型处理高分辨率图像问题,探索 RAG 应用可行性,提出 Retrieval-Augmented Perception (RAP) 框架,在多任务上提升性能,已被 ICML 2025 接收。

机器之心
算法论文7

The Batch: 881 | 一千万 token 的输入上下文

Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务中表现佳,但小模型,大规模表现未知。

DeeplearningAI
开源动态7

Lovart的开源平替产品,完全本地免费的AI设计Agent。

Lovart是热门AI设计Agent但使用成本高,现找到开源平替项目Jaaz。它接OpenAI绘图API,支持Comfyui等本地工具,能免费本地使用,功能丰富,还将推视频生成功能。

开源AI项目落地
开源动态8

开源RAG又添新军!港大开源多模态RAG神器,多文档格式统一解析、知识图谱索引与混合检索!

在AI信息检索领域,传统RAG系统难处理复杂文档。港大数据智能实验室开源RAG - Anything,可提供端到端解决方案,能多格式解析、构建知识图谱和混合检索,优势显著。

开源星探
算法论文8

只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max

现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。

机器之心
新闻资讯7

刚刚,阿里官方认领神秘「欢乐马」,来自ATH郑波团队

周二晚间,AI评测平台Artificial Analysis上,‘欢乐马’空降榜首引热议。现阿里官方认领,它是ATH郑波团队模型,正内测,近期将开放API。其在多项排行榜表现出色,支持四种视频生成模式。

机器之心
产品应用7

我在微信免费养「龙虾」,玩到上瘾,这组CP太强了

2026 开年「龙虾热」渗透各类任务场景,腾讯动作密集。其自研 WorkBuddy 优势明显,与微信 ClawBot 联动成「官配」。经测试,它能高效处理多类任务,还为用户提供权益,腾讯龙虾矩阵加速成形。

机器之心
7

The Batch: 886 | OpenAI 与 Meta 多元化其 AI 产品线

OpenAI和Meta此前专注聊天机器人,如今分别推出新举措。OpenAI推Sora 2、ChatGPT Pulse和Instant Checkout;Meta推出Vibes。新项目利用AI提升用户参与度与收入,探索社交视频领域和大模型与商务融合。

DeeplearningAI