「多模态输出」共找到 1197 篇相关文章
I/O大会开完,谷歌连搜索框都变智能体了
当地时间周二谷歌I/O大会举行,转型智能体时代。谷歌推出Gemini 3.5系列模型,轻量级3.5 Flash已开放,重量级3.5 Pro仍在开发。还发布全新AI智能体Spark,改造谷歌搜索,推出多模态模型Gemini Omni。
免费开源低成本的3D动作捕捉系统
FreeMoCap是无标记点3D动作捕捉系统,用普通USB摄像头就能实现研究级全身动作捕捉,支持单/多相机模式,输出3D骨骼数据,可导入Blender等工具,具有低成本、开源可扩展等优势。
最新!Demis Hassabis:Agent才刚刚开始,AI下一步是创造虚拟细胞
DeepMind掌门人Demis Hassabis在专访中谈到AGI发展,认为当前技术距AGI可能差一两个大突破,预计2030年左右实现。还探讨了记忆、Agent、推理等问题,提及开源、多模态等情况,展望了生物领域虚拟细胞等。
刚刚,阿里Qwen3.6又悄悄放出4个开源权重,卷疯了
继今年2月发布Qwen3.5系列后,阿里推出Qwen3.6多个开源权重版本。Qwen3.6优先保障稳定性与真实场景可用性,为开发者提供更好编码体验。介绍了Qwen3.6 - 27B和Qwen3.6 - 35B - A3B亮点。
π0.7的泛化能力有多强?零样本纯靠口述就能用空气炸锅,演示完换个机械臂也能叠衣服
2026年4月16日,美国明星机器人AI公司Physical Intelligence发布模型π0.7。它具组合泛化能力,借助多模态提示框架,能零样本完成新任务。在空气炸锅、叠衣服等实验中表现出色,有望推动具身智能发展。
字节Seedance 2.0发论文了,171人署名,吴永辉曾妍在列
现象级AI视频技术字节Seedance 2.0在arXiv发论文,公布26页Benchmark和170位贡献者名单。此时它正通过Byteplus平台铺向全球,支持多模态输入。该模型突破瓶颈,评测表现优异,团队近半换血。
刚刚,Meta 发布新模型,股价大涨 10%
Meta发布新模型Muse Spark,是原生多模态推理模型,支持多种功能。其沉思模式处理复杂问题表现佳,还有新购物模式。虽评论区有质疑,但Meta股价大涨。模型未开放API等,实际实力待察。
用 AI Coding 工具生成 60 万字奇幻世界设定的实践记录
作者先尝试用 Python/C# 编排 LLM 调用生成小说世界设定,遇节点信息查看、输出形态等问题。后用 AI Coding CLI,经搭建骨架、基础层展开等阶段生成 60 万字奇幻世界设定,还基于此创作叙事。
手机版openclawd来了,无需Root,让 AI 像人类一样使用你的手机
Andclaw是个人开发者开源的Android自动化工具,核心理念是让AI像人类一样使用手机。它无需Root、电脑,通过无障碍服务读取屏幕内容,让AI分析操作。具备无需Root、独立运行等功能,还支持多模态输入。
基于 Qwen3-VL-Embedding-8B 实现文搜图语义内容检索的实战教程
文章围绕Qwen3-VL-Embedding-8B模型展开,介绍其核心特性、技术架构等,提供环境搭建、模型部署指南,给出文搜图系统架构及代码实现,还通过电商、社交媒体、企业文档三个实战案例展示应用,最后讲解性能优化与常见问题解决方法。