「多模态应用」共找到 2966 篇相关文章
Databricks收购Mooncake,Lakebase想给AI应用换个“心”
Databricks收购Mooncake Labs,旨在推进为AI智能体优化的新型OLTP数据库Lakebase。它基于Postgres,想让数据直接用于工作负载,省去ETL流程,简化AI应用后端数据架构设计。
对话 PyTorch 掌门人 Matt White:AI 应用应该做到“润物细无声”
近日,PyTorch 基金会执行董事 Matt White 在北京智源大会指出,开源虽形成‘良性循环’,但围绕‘开放’定义权的战争已打响。他还分享了对 PyTorch 发展、AI 应用等多方面的看法。
从大模型到多模态,图文混排Agent彻底起飞~
上周智谱多模态开源周,从GLM 4.6v到Autoglm,其图文并排使用场景很吸睛。上传PDF论文,它能生成图文混排解读文章,效果好。作者逆向原理复刻代码,还分享GLM 4.6V三个有意思的能力。
融合风控知识的大模型体系建设与应用实践
腾讯算法专家欧阳天雄在AICon大会分享《大模型驱动下的智能风控落地实践》,介绍腾讯天御融合海量风控知识构建金融风控大模型,解决传统风控模型难题,还展示构建技术、工程实践及落地案例,为金融风控提供新思路。
开源SOTA!商汤原生多模态一个大脑完成看图、推理、作画
商汤开源日日新SenseNova U1,用NEO - unify架构让像素和文字自由协作,多项指标达开源SOTA,适配10家国产芯片。它能完成看图、推理、作画等多任务,虽有局限,但后续优化值得期待。
OpenAI发力AI应用!前Meta产品总裁将任应用部门CEO
Sam Altman宣布生鲜电商平台Instacart首席执行官Fidgi Simo加入OpenAI,担任新设立的应用部门CEO。该部门将整合业务和运营团队,推动研究成果惠及全球用户,实现规模化扩张。
大涨240%,Doc-Researcher确立多模态文档深度研究新范式
在ChatGPT引领的AI革命中,大语言模型面对专业复杂文档常“束手无策”。Doc-Researcher提出三位一体解决方案,构建M4DocBench评测,性能远超现有方案,还适用于多产业场景。
构建分层的 Agentic RAG 系统:具备自主纠错的多模态推理
企业 AI 团队面临 RAG 系统在处理结构化与非结构化数据时的难题。本文探讨用分层多智能体编排解决“模态鸿沟”,介绍 Protocol - H 架构,阐述组件、机制、实现与集成,经基准测试验证其优势,还提及未来研究方向。
ScreenCoder:视觉-代码对齐新范式,为多模态程序合成开辟道路
前端开发中UI转代码耗时易错,现有工具存在不足。ScreenCoder提出模块化多智能体框架,通过三阶段分工协作实现代码生成,还构建数据引擎推动VLMs进化,实验表现出色,为多模态程序合成开辟道路。
让龙虾看懂屏幕!谷歌多模态新成果,文本图像视频音频进同一空间
谷歌发布首个原生多模态嵌入模型Gemini Embedding 2,将文本、图像、视频、音频和文档映射进同一嵌入空间,支持多模态混合输入,为AI Agent“看懂”世界提供关键基础,已展开公测。