多模态生成」共找到 2916 篇相关文章

开源动态8

NVIDIA开源“Banana”级黑科技!会懂物理、理解时间的图像编辑模型!

继谷歌Banana后,英伟达开源物理级图像编辑模型ChronoEdit - 14B,被称‘NVIDIA版的Banana’。它有‘时间观念’和‘物理常识’,能按描述生成符合物理规律图像,适用于多领域。

开源星探
推荐文章7

评论送书 | 奇点何时到来?AI会成为人类的威胁吗 ?

文章从非线性非平衡多自由度系统的视角,探讨生成式AI未来发展态势,对‘规模扩大至临界点会实现奇点’及‘AI成人类威胁’的观点存疑,指出人类滥用AI才是现实威胁。

AIGC开放社区
产品应用7

小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%

小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%。它能完成输入视觉回答问题、做几何体等任务,重点解决多模态推理、视觉理解及与人类偏好对齐问题,介绍了模型结构、训练阶段等内容。

CourseAI
产品应用7

腾讯发布WeKnora知识库,无缝链接微信生态

微信团队推出基于大模型的文档理解检索框架WeKnora,应用于复杂异构文档场景。它采用多模态预处理等设计,有文档解析、意图识别等特点,可本地私有化,还能与微信生态无缝衔接。

CourseAI
新闻资讯8

苹果放王炸!开放大模型访问权、全家桶集成ChatGPT,人人能开发AI应用

苹果在“WWDC 2025”大会宣布在多设备集成Apple Intelligence功能,含ChatGPT图像生成等。开放基础模型访问权,开发者可开发适配应用。新功能将逐步开启测试,今年秋季部分用户可用。

AIGC开放社区
算法论文7

NICE59期 | Agent进入下一篇章!Alita:不靠人工预设,自己造MCP自我进化的AI

这篇论文提出让 Agent 主动创造解决 MCP 的工具实现自我进化,工具可网上检索或自主编写。Alita 做法更通用实效,还提出‘Agent 蒸馏’思想,其生成的 MCP 已用于‘manus’。

深度学习自然语言处理
开源动态7

DeepSeek之后:中国开源人工智能生态的架构选择

自2025年1月“DeepSeek时刻”,中国开源社区有历史性进展,讨论焦点从模型转向架构与硬件选择。技术架构多元,多模态能力扩展,开源许可宽松,小模型走红,本土硬件采用加快。

Hugging Face
算法论文8

Meta超级智能实验室首篇论文:重新定义RAG

Meta超级智能实验室首篇论文提出REFRAG框架,重新定义RAG。它通过“压缩、感知、扩展”流程优化LLM处理外部知识方式,最高将首字生成延迟加速30倍,且性能无损。

量子位
开源动态7

Skill开发黄金法则!谷歌放出5种智能体Skill设计模式

谷歌工程师研究Skill开发生态,浓缩出5条黄金法则与5种设计模式,包括工具封装器、生成器等,每种模式附可运行ADK代码,还能组合使用,助开发者构建更智能的Agent。

AIGC开放社区
开源动态8

NeurIPS 25开新坑:145万个图文对,覆盖八种主流水下理解任务

华中科技大学团队推出首个水下多模态大模型NAUTILUS,支持8种水下场景理解任务,还开源145万图文对的NautData数据集。模型通过VFE模块解决水下图像问题,性能超越现有模型,恶劣环境表现更佳。

新智元