多模态交互」共找到 1457 篇相关文章

产品应用8

30秒,我用蚂蚁灵光复刻了个支付宝(doge)

蚂蚁集团推出全模态通用AI助手灵光,最快30秒生成私人定制小APP,可编辑交互分享。实测其功能丰富且专业,实现多模态输出和多智能体协作。还对比了与千问区别,介绍蚂蚁AGI布局。

量子位
开源动态8

全模态RAG突破文本局限,港大构建跨模态一体化系统

香港大学黄超教授团队开源多模态智能处理系统RAG - Anything,突破传统RAG技术单一文本局限,整合多模态文档解析等核心能力,解决现有RAG系统痛点,具备多方面技术亮点,有便捷部署方式和多场景应用模式。

量子位
推荐文章8

第一章:AI 技术前沿全景

文章聚焦AI Agent技术前沿,阐述大语言模型三次能力跃迁,从涌现能力到对齐指令遵循,再到推理与行动。还提及Scaling Law变化,推理时计算扩展更划算,介绍代表性推理方案及多模态融合,指出Agent打破传统对话AI局限。

CourseAI
开源动态7

Unsloth宣布更新,可免费用强化学习训练视觉大模型Qwen2.5-VL-7B

Unsloth宣布更新,支持视觉/多模态模型强化学习训练,含Gemma 3和Qwen2.5 - VL。其独特机制使VLM RL训练速度提升、显存占用降90%等。还引入GSPO算法,能在免费Colab T4 GPU训练Qwen2.5 - VL - 7B。

AI工程化
开源动态8

智能体编程“小钢炮”:Qwen3.6-35B-A3B开源!

Qwen3.6-35B-A3B开源,是稀疏MoE模型,总参350亿、激活参数30亿,轻量高效,在智能体编程等方面表现卓越,超越前代,可与稠密模型媲美,支持多模态,已在Qwen Studio上线并发布开源权重。

千问大模型
产品应用7

新鲜出炉!谷歌nano banana模型刷屏背后技术揭秘

谷歌Nano Banana模型刷屏,其项目负责人等揭秘技术。它有场景一致性、文本渲染等特性,团队用文本渲染能力作评估指标,还靠原生多模态、交错式生成等技术,结合用户反馈实现多方面进步,图像模型做PPT尚处起步。

AI寒武纪
新闻资讯7

关于我用ChatGPT模拟撒旦并支付了订阅费这件事

新智元报道,硅谷科技巨头将AI注入基督教领域,出现如「Text with Jesus」等App。信仰交互变即时亲切,神成算法打造的伴侣。但也有争议,如算法妥协、恶魔付费解锁等,这像数字巴别塔,挑战传统信仰。

新智元
产品应用7

Unsloth发布Qwen3-VL本地运行和微调指南,修复隐藏bug

Unsloth团队修复Qwen3-VL系列模型聊天模板语法问题,重新上传GGUF量化文件,使模型可本地稳定运行。介绍了不同规格模型硬件需求、表现,给出部署步骤、参数差异,还展示多模态能力测试,提供多种格式模型及微调工具。

AI工程化
算法论文8

两张图就能重构3D空间?清华&NTU利用生成模型解锁空间智能新范式

ICCV 2025中稿的LangScene-X以全新生成式框架,仅用稀疏视图就能构建可泛化的3D语言嵌入场景。它攻克传统方法痛点,将多模态信息统一在单一模型,为空间智能领域打开新大门。

量子位
产品应用8

劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束

谷歌发布世界模型原型 Project Genie,用一句话或图就能生成可玩交互的实时虚拟世界,由劈柴哥和哈萨比斯站台。它基于 Genie 3、Nano Banana Pro 和 Gemini 构建,解决了世界模型长期以来的短板,目前处于实验阶段。

InfoQ