「多模态视频生成」共找到 3295 篇相关文章
这个开源项目把视频处理与投稿接成一条流水线
Y2A-Auto是面向YouTube、AcFun和bilibili的自动化处理工具,将下载、识别、翻译等操作集成到Web管理后台。用户可手动或自动处理,支持多平台投稿,有多种功能和灵活配置,适合持续处理授权内容的用户。
NVIDIA重磅开源!OmniVinci 仅 9B 模型就拿下多模态冠军!
英伟达推出全模态大语言模型 OmniVinci,架构有三大创新。OmniVinci - 9B 模型表现亮眼,多测试中大幅超 Qwen2.5 - Omni,且训练量仅为其六分之一。其架构经多阶段流程实现全模态理解,还支持多种功能。
大涨240%,Doc-Researcher确立多模态文档深度研究新范式
在ChatGPT引领的AI革命中,大语言模型面对专业复杂文档常“束手无策”。Doc-Researcher提出三位一体解决方案,构建M4DocBench评测,性能远超现有方案,还适用于多产业场景。
Windows AI助手免费进化!能操作电脑、登录网页、生成代码
Windows Copilot正式更新,Microsoft 365 Copilot中Researcher智能体新增“计算机使用”能力,能操作电脑、登录网页、生成代码等。更新已在预览版上线,还介绍了其运行机制和性能测试情况。
倒反天罡:ChatGPT教人说话?36万视频+77万播客已证实!
最新研究警告,ChatGPT正改变英语表达方式,植入自身偏好。研究人员分析超36万视频和77万播客,发现GPT词汇使用率显著攀升。但研究有局限,且AI沟通还引发信任危机等问题。
构建分层的 Agentic RAG 系统:具备自主纠错的多模态推理
企业 AI 团队面临 RAG 系统在处理结构化与非结构化数据时的难题。本文探讨用分层多智能体编排解决“模态鸿沟”,介绍 Protocol - H 架构,阐述组件、机制、实现与集成,经基准测试验证其优势,还提及未来研究方向。
阿里搞了个全能解析器,文档、图片、音频、视频一锅端
阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。
Sora 2深夜来袭,OpenAI直接推出App,视频ChatGPT时刻到了
别家节前卷大模型时,OpenAI 悄悄发布 Sora2 并推出 App,还有配套视频推送算法防成瘾。Sora2 在物理准确性等方面优于以往系统,具备同步对话和音效能力,Altman 称是 ChatGPT for creativity 时刻。
Z-Image标准版开源:更具可塑性的图像生成全能基座
Z-Image标准版开源,它是为开发者准备的强大画板,解决了生成模型同质化问题。其保留完整权重,在微调、风格化上潜力大,采用创新架构,训练定位SFT阶段,有完整CFG支持,还提供完善工具链。
现在,你可以在手机上用AI生成一个APP了。
作者参加百度Create 2026 AI开发者大会,介绍百度秒哒。它是能帮开发产品的Agent,虽与顶级产品有差距,但全链路适配、对国内生态友好。大会上线APP版,能直接生成安装包,操作简单,解锁普通人创造力。