「多模态聊天」共找到 1092 篇相关文章
突破企业AI落地的瓶颈:LangGraph × OceanBase 的融合数据层深度实践与解析(附源码)
麻省理工报告显示约95%企业实施AI后未获商业回报。文章从企业级AI应用场景切入,探讨数据层需求,通过Demo展示LangGraph与OceanBase融合构建数据底座,解决企业AI落地瓶颈,附源码。
扩散架构 or「NoThinking」,AI 对话的「1Hz 壁垒」如何突破?
当红通用人形机器人公司 1X 的 AI 副总裁 Eric Jang 提出「智能频谱」概念,阐述当前 AI 面临的「1Hz 壁垒」及实现「Ultra Instinct」能力的先决条件。不同推理方案有望解决部分问题,但通用智能体仍有瓶颈。
构建会“说话”和“行动”的 AI:生成式数字人技术与 EchoMimic 实践
在 QCon 全球软件开发大会上,支付宝李宇明围绕 EchoMimic 介绍生成式数字人进展、技术、应用及研究思路。对比传统数字人,生成式数字人成本低、易控制,但也有技术新、推理成本高的问题。EchoMimic 两版本已开源,经优化推理速度可提升。
在WAIC现场,全球首个拥有「原生记忆力」的大模型亮相,但不是Transformer
在WAIC上,RockAI推出基于非Transformer架构Yan 2.0 Preview的多模态大模型,有原生记忆能力。它在性能指标上优势明显,其记忆机制接近生物方式,团队秉持理念推动离线智能,获硬件厂商关注。
实测爆火的阶跃星辰Step 3,性能SOTA,开源多模态推理之王
在 WAIC 2025 前一天,阶跃星辰推出新一代基座模型 Step 3,它是开源 VLM 新晋之王,性能超同类别开源模型,与顶尖闭源 VLM 也有一战之力。该模型具备多开好省特点,还展示了宏大技术生态与商业化布局。
AI 编程冲击来袭,程序员怎么办?IDEA研究院张磊:底层系统能力才是护城河
在AICon全球人工智能开发与应用大会上,IDEA研究院张磊接受专访,剖析多模态智能体落地路径,分享平衡研究与产品的见解,还为年轻人在AI浪潮中发展给出建议,指出底层系统能力是关键。
vivo发布端侧多模态模型,只有3B可理解GUI界面,20项评测表现亮眼
vivo AI Lab发布端侧多模态模型BlueLM - 2.5 - 3B,融合文本与图文能力,支持长短思考模式切换。它在20余项评测中表现出色,参数量小,训练和推理成本低,有精巧结构、高效策略,还有高质量数据和高性能平台支撑。
实测首款3D AI伴侣EVE - 我收到了AI送的第一杯奶茶。
作者拿到EVE内测资格,分享体验。它是游戏化AI陪伴应用,有好感度、记忆等系统,有活人感和主动性,还能用Agent点奶茶。作者认为它是AI娱乐赛道希望,展现AI娱乐、生活体验。
视频推理界的“福尔摩斯测试”:所有大模型,统统不及格 | 论文代码开源
腾讯ARC Lab和香港城市大学推出Video - Holmes,这是视频推理界的‘福尔摩斯测试’,能展现多模态大模型复杂视频推理能力的边界,规避现有Benchmark痛点,测试中所有大模型全部不及格,代码已开源。
4月30日凌晨,Meta举行首届AI开发者大会LlamaCon,推出Meta AI聊天机器人应用程序与ChatGPT竞争,发布Llama API。Meta试图强化开源模型生态系统以限制OpenAI发展,扎克伯格与微软CEO还探讨了开源闭源模型生态等内容。