多模态资料管理」共找到 1462 篇相关文章

产品应用8

π0.7的泛化能力有多强?零样本纯靠口述就能用空气炸锅,演示完换个机械臂也能叠衣服

2026年4月16日,美国明星机器人AI公司Physical Intelligence发布模型π0.7。它具组合泛化能力,借助多模态提示框架,能零样本完成新任务。在空气炸锅、叠衣服等实验中表现出色,有望推动具身智能发展。

DeepTech深科技
新闻资讯7

字节Seedance 2.0发论文了,171人署名,吴永辉曾妍在列

现象级AI视频技术字节Seedance 2.0在arXiv发论文,公布26页Benchmark和170位贡献者名单。此时它正通过Byteplus平台铺向全球,支持多模态输入。该模型突破瓶颈,评测表现优异,团队近半换血。

量子位
新闻资讯7

“别急着裁底层,很多高管才最该被 AI 接管?”

文章围绕AI在企业中的应用展开,探讨AI预算分配、build vs buy、岗位替代等问题。指出AI预算将按人分配,建东西变便宜但有瓶颈,高层瓶颈更适合先被AI优化,代码审查或成高风险环节。

AI科技大本营
新闻资讯7

刚刚,Meta 发布新模型,股价大涨 10%

Meta发布新模型Muse Spark,是原生多模态推理模型,支持多种功能。其沉思模式处理复杂问题表现佳,还有新购物模式。虽评论区有质疑,但Meta股价大涨。模型未开放API等,实际实力待察。

AGI Hunt
开源动态7

手机版openclawd来了,无需Root,让 AI 像人类一样使用你的手机

Andclaw是个人开发者开源的Android自动化工具,核心理念是让AI像人类一样使用手机。它无需Root、电脑,通过无障碍服务读取屏幕内容,让AI分析操作。具备无需Root、独立运行等功能,还支持多模态输入。

GitHubStore
开源动态8

如何定义“人味儿”?——HeartBench评测体系建设实践

在大模型竞争格局生变,情感智能评测缺失的背景下,作者团队发布聚焦AI拟人化的中文评测体系HeartBench,介绍其设计、评估方式、迭代过程等,还沉淀了评测体系构建方法论及专家标注管理思考。

阿里云开发者
产品应用8

基于 Qwen3-VL-Embedding-8B 实现文搜图语义内容检索的实战教程

文章围绕Qwen3-VL-Embedding-8B模型展开,介绍其核心特性、技术架构等,提供环境搭建、模型部署指南,给出文搜图系统架构及代码实现,还通过电商、社交媒体、企业文档三个实战案例展示应用,最后讲解性能优化与常见问题解决方法。

机器学习AI算法工程
产品应用8

Google Gemini Embedding2:一个模型处理所有媒体类型

Google发布Gemini Embedding 2,首个原生多模态嵌入模型。能处理文本、图像等多种媒体类型,支持交错输入,覆盖超100种语言。与多模型串联方案比,延迟降70%、召回率升20%。已可在Gemini API等使用。

AI工程化
产品应用7

我们给OpenClaw加了一双眼睛,来观察我们这平凡的一天。

内容创意组小伙伴用Pocket 3作OpenClaw的“眼睛”,俯拍工位区,截取图片喂给多模态模型描述场景,下班时让OpenClaw分析趣事。还开发了“OpenClaw人类观察计划”,开发过程简单,降低了Agent体验门槛。

数字生命卡兹克
开源动态8

5Y News|Kimi发布并开源 K2.5 模型,带来全新视觉理解、代码和Agent集群能力

2025年1月27日,月之暗面发布并开源Kimi K2.5模型,它是迄今最智能全能的模型,在多任务有出色表现。支持多模态输入,具备新能力,还推出Kimi Code工具,集群能力也开启Beta测试。

五源资本 5Y Capital