多模态视觉语言模型」共找到 2255 篇相关文章

开源动态8

一键搞定双语播客的项目,效率+200%,太6了!

文章介绍开源项目Twocast,它是AI播客生成器,能模拟双人自然对话,3分钟产出一期播客。有双人对话、多输入、多语言等特色,提供两种安装方式,适合多类人群。

开源先锋
推荐文章8

Claude code:下一个千亿级软件市场的蓝图

LATE CHECKOUT CEO认为Claude Code将带来软件行业变革,它驯服终端,让自然交互成趋势,会催生新机遇和超级用户,未来软件易用性价值更高,技术将适应人类语言

AI寒武纪
开源动态7

华南理工开源小智AI硬件后端服务,支持MCP。

华南理工大学刘思源教授团队研发开源后端服务项目 xiaozhi-esp32-server,基于人机共生智能理论,为 xiaozhi-esp32 硬件提供支持,采用多语言实现,支持 MCP 接入等功能,适配多配置方案。

开源AI项目落地
新闻资讯8

编码器-解码器架构的复兴?谷歌一口气发布32个T5Gemma模型

谷歌在xAI吸引眼球时更新Gemma系列模型,发布多模态模型MedGemma,还一口气推出32个T5Gemma模型。该模型基于适应技术,性能表现佳,引发编码器 - 解码器架构复兴讨论。

机器之心
算法论文8

AI"学霸"也解不出高中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板

耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有高质量数据、多模态多题型测试和精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。

深度学习自然语言处理
开源动态8

文心大模型 4.5 系列正式开源,涵盖 10 余款模型

6月30日,百度正式开源文心大模型4.5系列,含10款模型,实现预训练权重和推理代码全开源。可在飞桨星河社区等平台下载,百度实现框架与模型“双层开源”,技术创新多,性能表现优。

AI前线
开源动态7

字节开源了一个了不得的模型!

字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。

探索AGI
开源动态8

字节跳动&清华大学开源多模态时序大模型ChatTS,可实现时序数据对话与推理

字节跳动与清华合作开源多模态时序大模型ChatTS,可实现时序数据对话与推理。它用合成数据训练,解决了数据稀缺等问题,在评估中表现远超基线模型,未来可拓展至更高阶任务。

机器之心
开源动态8

6.5k星!轻量级多智能体对话编排框架Agent Squad

Agent Squad是轻量级多智能体对话编排框架,有6.5k星。它能管理多AI代理、处理复杂对话,具智能意图分类等特性。新SupervisorAgent可协调多专业代理,还有演示应用及多种使用示例。

GitHubStore
产品应用8

登顶 Arena!MiniMax 最新 Speech-02 模型屠榜:超越OpenAI、ElevenLabs,人声相似度99%

近期TTS模型领域发展火热,众多机构纷纷发力。MiniMax推出的Speech - 02模型登顶Arena榜单,在字错率和相似度等指标上表现出色,具备超拟人、个性化、多样性特点,性价比高,还创新架构解决了现有痛点。

AI前线