「多模态视频生成」共找到 3298 篇相关文章
AI大牛刘威创立的Video Rebirth,刚刚又完成8000万美元融资
AI视频生成企业Video Rebirth完成8000万美元融资,由AMD Ventures、现代汽车等跨界投资。其由刘威创立,首创Dual Diffusion Transformer架构,新资金用于Bach模型商业化与全球扩张。
腾讯发布WeKnora知识库,无缝链接微信生态
微信团队推出基于大模型的文档理解检索框架WeKnora,应用于复杂异构文档场景。它采用多模态预处理等设计,有文档解析、意图识别等特点,可本地私有化,还能与微信生态无缝衔接。
苹果放王炸!开放大模型访问权、全家桶集成ChatGPT,人人能开发AI应用
苹果在“WWDC 2025”大会宣布在多设备集成Apple Intelligence功能,含ChatGPT图像生成等。开放基础模型访问权,开发者可开发适配应用。新功能将逐步开启测试,今年秋季部分用户可用。
独家|华为系帧跃科技完成千万美金天使轮融资,将发布视频产品 Leadde
AI 科技评论独家获悉,主攻 AI 交互式视频赛道的帧跃科技完成千万美金级天使轮融资。创始人杨昌鹏和联合创始人李明磊均有华为任职经历。公司提出‘三位一体’架构,2026 年下半年将发布产品 Leadde。
NICE59期 | Agent进入下一篇章!Alita:不靠人工预设,自己造MCP自我进化的AI
这篇论文提出让 Agent 主动创造解决 MCP 的工具实现自我进化,工具可网上检索或自主编写。Alita 做法更通用实效,还提出‘Agent 蒸馏’思想,其生成的 MCP 已用于‘manus’。
DeepSeek之后:中国开源人工智能生态的架构选择
自2025年1月“DeepSeek时刻”,中国开源社区有历史性进展,讨论焦点从模型转向架构与硬件选择。技术架构多元,多模态能力扩展,开源许可宽松,小模型走红,本土硬件采用加快。
Meta超级智能实验室首篇论文:重新定义RAG
Meta超级智能实验室首篇论文提出REFRAG框架,重新定义RAG。它通过“压缩、感知、扩展”流程优化LLM处理外部知识方式,最高将首字生成延迟加速30倍,且性能无损。
Skill开发黄金法则!谷歌放出5种智能体Skill设计模式
谷歌工程师研究Skill开发生态,浓缩出5条黄金法则与5种设计模式,包括工具封装器、生成器等,每种模式附可运行ADK代码,还能组合使用,助开发者构建更智能的Agent。
NeurIPS 25开新坑:145万个图文对,覆盖八种主流水下理解任务
华中科技大学团队推出首个水下多模态大模型NAUTILUS,支持8种水下场景理解任务,还开源145万图文对的NautData数据集。模型通过VFE模块解决水下图像问题,性能超越现有模型,恶劣环境表现更佳。
跨平台智能媒体处理与创作工具箱
pyMediaTools 是基于 PySide6 的跨平台桌面应用,集成媒体批处理和 AI 音视频创作工具。利用 FFmpeg、ElevenLabs 和 Groq API,有格式转换、语音合成等功能,还介绍了安装、配置、打包方法。