「多模态体验」共找到 1611 篇相关文章
豆包的新身份曝光:在国际艺术展当起了“AI讲解员”
文章讲述作者在浦东美术馆「AI与艺术」豆包讲解体验日活动的经历,实测豆包作为AI讲解员的业务水平,如筛重点、实时讲解、补知识,还揭秘其靠豆包大模型1.8的多模态处理等能力任职。
Lumina-DiMOO:多模态扩散语言模型重塑图像生成与理解
上海人工智能实验室推出多模态扩散语言模型 Lumina - DiMOO,它基于离散扩散建模,打破多模态任务壁垒。相比传统自回归架构模型,它解决了生成慢、质量受限等问题,在多项评测中夺魁。
在北京,总要去东城体验一次“数字幻境”吧
在北京东城,XR沉浸式技术落地生根,打造出多种新型消费场景。王府井有裸眼3D大屏、元宇宙沉浸场等;前门大街的科技体验馆有VR沉浸式体验剧;隆福寺有索尼探梦、XR艺术空间等科技玩法。
工业异常检测新突破,复旦等多模态融合监测入选CVPR 2025
复旦大学等机构联合发布高精度多模态数据集Real - IAD D³,提出多模态融合检测方法D³M,成果被CVPR 2025收录。该数据集含多类数据,提升检测性能,此前相关工作也被CVPR 2024收录。
多模态BUG修复新SOTA:慕尼黑工大GUIRepair登上SWE-bench Multimodal榜单第一
自动化修复软件缺陷是长期目标,多模态问题修复受关注。慕尼黑工业大学团队提出GUIRepair,融合APR与GUI Testing知识,登上SWE - bench Multimodal榜单第一,为多模态软件自动修复开辟新路。
AI真有希望考清北了!豆包1.6多模态推理发威,闯关数理化带图大题
火山引擎原动力大会发布豆包大模型1.6,它是国内首款多模态SOTA模型,支持256k上下文长度。实测中它解答高考数理化带图大题表现出色,还具备图像识别、视频理解、GUI操作等能力。此外,火山引擎还推出系列工具和平台助力企业。
全球首款AI原生UGC游戏引擎诞生!输入文字秒建GTA世界,试玩体验来了
全球首个由实时世界模型驱动的AI原生游戏引擎Mirage问世,玩家能实时构思、生成并体验游戏世界。虽当前体验有不足,但它有显著优势,支持多元游戏类型,基于前沿技术构建。
尖峰对话17分钟全记录:Hinton与周伯文的思想碰撞
7月26日,人工智能教父Geoffrey Hinton与周伯文教授进行17分钟对话,谈及AI多模态大模型前沿、“主观体验”和“意识”等话题。Hinton认为当今多模态聊天机器人已有意识,还探讨了训练善良AI及AI推动科学进步等问题。
华为Doc-Researcher 布局感知+视觉语义双杀
现有深度研究系统依赖文本网页数据,忽视多模态文档知识。华为Doc - Researcher系统解决多模态文档解析不足、检索策略有限、缺乏深度研究能力等问题,含多模块,能处理复杂多模态任务。
OpenAI的Atlas,全网都没有提到的产品细节在这
作者本期待Gemini 3,结果体验Google AI Studio产品后觉得拉胯。此时OpenAI发布Atlas,作者体验后细节感满满,将其设为默认浏览器。文中介绍了Atlas负责人履历及诸多用户体验细节,也指出其功能尚不完善。