「视觉智能工坊」共找到 3938 篇相关文章
OpenClaw 类自主智能体生态构建
文章围绕OpenClaw类自主智能体生态展开,从生态视角、记忆系统、上下文管理等多方面阐述其构建,还分析了安全风险、治理体系、角色分工及面临的挑战与机会,为理解和发展Agent生态提供参考。
DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角
DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态大模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。
华为Doc-Researcher 布局感知+视觉语义双杀
现有深度研究系统依赖文本网页数据,忽视多模态文档知识。华为Doc - Researcher系统解决多模态文档解析不足、检索策略有限、缺乏深度研究能力等问题,含多模块,能处理复杂多模态任务。
刚刚,OpenAI最强编程智能体上线ChatGPT
OpenAI宣布在ChatGPT中引入Codex研究预览版。它是云端软件工程智能体,能并行处理多项编程任务。自今日起,部分用户可使用,后续将推付费选项。目前处于早期开发阶段,未来计划推更灵活工作流。
李飞飞空间智能独角兽开源底层技术!AI生成3D世界在所有设备流畅运行空间智能的“着色器”来了
李飞飞创立的World Labs开源核心技术Forge渲染器,可在各设备实时、流畅渲染AI生成的3D世界。它是Web端3D高斯泼溅渲染器,地位似传统3D领域“着色器”,还解决了3DGS渲染难题。
18岁华人开源成果,火爆具身智能赛道
18岁华人小哥Eddy Xu的初创公司Build AI开源了有史以来最大的人类为中心数据集Egocentric - 10K,含10亿帧画面,规模是同类的100倍,场景扩展至工厂。不过其缺乏多模态信息,且human - centric路线也有局限。
Gemini负责人爆料!多模态统一token表示,视觉至关重要
Gemini模型行为产品负责人Ani Baddepudi与谷歌AI Studio产品负责人探讨Gemini多模态技术,涉及设计理念、应用及发展方向。指出多模态对构建AGI重要,还介绍Gemini 2.5视频理解亮点与‘万物皆视觉’理念。
别再“演智能”了,MiniMax Agent 才是真特工
2024 年有不少‘伪 Agent’项目,2025 年 AI Agent 开始在解决真实问题上落地。MiniMax Agent 在深度研究、网页生成、PPT 生成及多模态输入输出上超越竞品,其优势源于多方面,已从众多 Agent 产品中脱颖而出。
AI智能体的上下文工程:Manus的构建心得
季逸超在文章中分享了 Manus 构建 AI 智能代理的心得,包括围绕 KV 缓存设计、使用掩码管理工具、将文件系统作上下文等内容,还指出要保留错误信息、避免小样本带偏等。
如何构建企业级数据智能体:Data Agent 开发实践
本文介绍DMS的数据分析智能体Data Agent,它从实验室走向企业生产一线,革新数据分析范式。文中剖析构建要点,对比与传统BI、高级分析差异,阐述技术内核优化及企业级能力,为开发实践提供参考。