「多模态信息」共找到 1529 篇相关文章
字节开源了一个了不得的模型!
字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。
如果你想自己搞个Coze?开源版带你上车!(第二期)
文章聚焦想自建Coze平台的用户,介绍几个热门且功能多、有国产化考量的开源项目,如FastGPT、pyspur、sim、aiflowy,涵盖功能、开源协议等信息,助读者打造免费替代品。
字节跳动&清华大学开源多模态时序大模型ChatTS,可实现时序数据对话与推理
字节跳动与清华合作开源多模态时序大模型ChatTS,可实现时序数据对话与推理。它用合成数据训练,解决了数据稀缺等问题,在评估中表现远超基线模型,未来可拓展至更高阶任务。
3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!
文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在多个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。
The Batch: 972|Grok 的 Cursor 联盟获得回报
SpaceXAI发布与Cursor联合开发的视觉 - 语言模型Grok 4.6,已向开发者开放。介绍其输入/输出、特性等信息,阐述工作原理、性能表现,还提及相关新闻背景、重要原因及期望。
任何错误只犯一次:TencentDB Agent Memory 的团队记忆实践
文章聚焦 TencentDB Agent Memory 的团队记忆实践,从组织协作现状出发,阐述其原理、结构、构建方法,通过多方面测试验证其价值,提炼出设计原则,指出其核心是治理系统,目标是提升协作带宽。
独家对话大晓机器人陶大程:具身机器人大脑,不必装下整个世界|甲子光年
甲子光年独家对话大晓机器人陶大程,探讨具身机器人大脑。陶大程提出控制充分状态,大晓用Kairos模型回应世界模型问题,强调行动后果建模,还谈了数据处理、技术风险及应用场景等。
一年一度最值得关注的AI榜单来啦!申报即日启动
时值第四届中国AIGC产业峰会,量子位将评选2026年度值得关注的AIGC企业和产品。参选有条件,评选有维度,报名4月27日截止,结果5月峰会公布,还介绍了峰会相关信息。
刚刚,全球视频模型新王诞生了!
天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频生成从‘生成片段’走向完整视频生产,还应用于短剧平台DramaWave。
重建安全,Kai种子轮拿了1.25亿美元,有点象龙虾
大模型用于网络攻击,传统安全跟不上节奏。初创公司Kai首笔融资1.25亿美元,它从根本上重建安全,用单一智能体AI平台自主完成安全工作,愿景是整合网络安全和IT功能。