「多模态智能」共找到 4107 篇相关文章
刚刚,OpenAI最强编程智能体上线ChatGPT
OpenAI宣布在ChatGPT中引入Codex研究预览版。它是云端软件工程智能体,能并行处理多项编程任务。自今日起,部分用户可使用,后续将推付费选项。目前处于早期开发阶段,未来计划推更灵活工作流。
MoCa:首个大规模双向多模态表征模型
为解决VLM用于嵌入的痛点,中国人民大学等机构研究者提出MoCa框架,可将单向注意力VLM训练成双向多模态编码器。它分两阶段,实验效果好,未来可拓展模态、提升多语言适应等。
清华-腾讯联手:音频 - 视觉多模态任务统一框架
Crab是人大、清华和腾讯合作论文提出的模型,目标是高效一统多模态场景理解任务。它解决了音频 - 视觉理解模型任务干扰、合作显式化不足等难点,通过构建数据集、设计结构和统一架构实现多任务合作。
AI智能体的上下文工程:Manus的构建心得
季逸超在文章中分享了 Manus 构建 AI 智能代理的心得,包括围绕 KV 缓存设计、使用掩码管理工具、将文件系统作上下文等内容,还指出要保留错误信息、避免小样本带偏等。
从检测到通用感知:构建空间智能的基础
本文整理自张磊在AICon 2025北京的分享,分析语言与视觉原生模型架构区别,介绍基于Transformer的物体检测算法及开集检测技术进展,如Grounding DINO和DINO - X,还探讨其在多领域的应用和潜力。
如何构建企业级数据智能体:Data Agent 开发实践
本文介绍DMS的数据分析智能体Data Agent,它从实验室走向企业生产一线,革新数据分析范式。文中剖析构建要点,对比与传统BI、高级分析差异,阐述技术内核优化及企业级能力,为开发实践提供参考。
YOLO + OpenClaw 缺陷检测智能体,低代码实战方案
文章介绍了YOLO + OpenClaw缺陷检测智能体低代码实战方案。先指出实时检测延迟问题,提出离线自动化方案。接着讲训练YOLO模型、创建OpenClaw技能、配置自动化任务及企业微信集成,还对比了与人工质检效果。
老黄刚投的具身智能公司:三个华人创办
Dyna Robotics获1.2亿美元A轮融资,英伟达是新晋股东。该公司由三个华人创立,决定先将具身AGI带入商用场景,今年4月发布可落地商业场景的灵巧操作基础模型DYNA - 1,已在多场景应用。
The Batch: 864 | GLM-4.5:一款开放的智能体竞争者
大型语言模型推动智能体能力交互竞赛正酣,中国 Z.ai 推出 GLM - 4.5 系列开源权重模型,在推理、编程等基准测试中表现出色,还介绍了其工作原理、研究和测试结果等。
灵初智能陈源培:一个 00 后的机器人之梦
00 后陈源培是灵初智能联创,本科土木工程专业,大二因比赛对机器人感兴趣。他研究灵巧手,参与开源项目,灵初发布相关模型。他认为强化学习对灵巧手重要,还谈了模型、创业、落地等看法。