「多模态条件控制」共找到 1472 篇相关文章
科大讯飞研发总监王磊磊将在 AICon 上海分享多模态降噪技术的实践与应用
5月23 - 24日AICon上海大会将聚焦AI前沿与产业落地。科大讯飞王磊磊将分享《复杂场景下的语音交互,多模态降噪技术的实践与应用》,介绍基于多模态融合的降噪技术体系及其在智能硬件中的应用。
比英伟达早,比李飞飞强,大晓Kairos原生一体化世界模型定义物理AI新路线
大晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四大权威具身智能基准上全面登顶。
GPT-Image-2平替!最强开源生图模型来了
OpenAI推出GPT Image 2引发AI生图大战,国内厂商商汤反击,推出多模态理解生成模型SenseNova U1并全面开源。它通过自研架构实现理解、推理、生成统一,实测表现惊艳,能力全维度,与GPT-Image-2范式不同。
谷歌向左、李飞飞往右,阿里世界模型「快乐生蚝」杀出第三条路
阿里推出世界模型HappyOyster(快乐生蚝),基于原生多模态架构,有漫游和导演两大核心功能,可实时构建和交互。与文生视频模型不同,它能随时被干预。虽世界模型尚处早期,但应用场景广泛。
腾讯混元开源世界模型!2.0版本一键生成3D空间,游戏关卡随心造
4月16日,腾讯正式发布并开源混元3D世界模型2.0(HY - World 2.0)。它是多模态模型,能理解多种输入,自动生成、重建和模拟3D世界,支持多格式3D资产导出,可与游戏工作流对接。
全球第一,13个SOTA!我们找到了龙虾界掌管GUI的神
明略科技推出自研 GUI-VLA 智能体模型 Mano-P 1.0,不依赖 API 对接与浏览器场景,可操作桌面软件与网页界面。它在 13 个多模态基准榜单达 SOTA,支持本地运行,数据零上云,采用分阶段开源策略。
从Token到词元:全模态时代的基模与交互入口
2026年3月24日国家数据局确立“词元”为Token标准译名,Token生成与消耗方式在多模态场景正发生变化。模思智能获数亿融资,探索从语音到全模态的路径,成果颇丰且完成能力闭环,其发展受关注。
OpenClaw逼出Claude最强反击!GUI操控电脑和真人无差别,网友:这得花多少token?
Claude Code升级Computer Use能力精准反击OpenClaw,基于GUI操作,像真人操控电脑。升级后无需API或CLI改造,能操控传统软件,还上线远程控制、定时任务功能,有安全分层设计。已向Claude Pro和Max用户开放。
Meta 删邮件事故背后,OpenClaw 为什么会“失忆”?代码库维护者拆解记忆架构
OpenClaw在使用中易“失忆”,如Meta对齐总监用它处理邮件时失去控制。文章从代码库维护者视角,拆解记忆架构,介绍记忆层次、失败模式,给出配置建议和故障排除方法,助用户了解并优化其记忆机制。
对话「哈萨比斯传」作者:“他不喜欢奥特曼”
《哈萨比斯:谷歌AI之脑》作者塞巴斯蒂安·马拉比与量子位深度对谈,探讨书中细节与幕后故事。哈萨比斯不喜欢奥特曼,追求知识科学,与奥特曼价值观不同,书中也谈及他成长、错误及面临的困境。