「视觉推理功能」共找到 3979 篇相关文章
你奶奶也能看懂:DeepSeek-OCR的秘密。
本文介绍DeepSeek-OCR,它并非普通OCR工具,而是用“上下文光学压缩”将大量文本信息转为少量视觉Token。其架构含编码器和解码器,压缩效果惊人,重新定义AI“记忆”,或改变AI认知方式。
MemOS:一种用于 AI 应用的记忆操作系统
大型语言模型缺乏记忆管理系统,限制其发展。MemTensor与高校联合开源MemOS,它将记忆视为可管理资源,有三层架构,系统化三种记忆类型。评估显示其在推理、检索、加速等方面表现优异。
mem0推出王炸mcp工具OpenMemory,打造用户私有、跨应用的共享记忆层
mem0项目推出OpenMemory MCP,这是专为兼容MCP的AI客户端设计的私有记忆层,能解决跨AI工具的Context共享问题。它强调隐私和本地控制,功能实用,获用户积极反馈。
这个免费插件让我对着空气说话,Clawdbot竟然听懂了,还干完了活。
作者介绍免费插件让语音操控Clawdbot成现实,分享操作流程,还提到语音交互优势,对比《Her》中场景,指出当前设备功能实在,但情感上缺人味儿,更像《钢铁侠》里的贾维斯。
机器人GPT时刻!英伟达WAM赋予全机器人零样本操作能力
英伟达发布世界动作模型 DreamZero,通过耦合视频生成与动作预测,让机器人有物理直觉,能在陌生环境完成复杂任务。它用异构数据学习,适配不同机体,还经优化实现高速推理。
最新最完整的Agent Memory综述!
《Memory in the Age of AI Agents: A Survey》由多顶尖机构联合发布,对AI智能体记忆机制系统梳理。从形式、功能、动态维度厘清AI记忆本质,提出构建下一代强人工智能的蓝图。
1.4K标星!微软开源了一款全能AI客服系统,一键24小时实时对话!
数字化时代传统呼叫中心问题多,成本高。微软在GitHub开源Call Center AI,基于Azure + GPT的智能语音客服系统,具多项功能,采用三层设计,适用多行业,可落地,或成企业标配。
这款OCR神器绝了,PDF、表格、手写体通吃,20+文档支持,9.4K Star!
开源君在Github发现开源OCR工具Zerox,由Omni - AI团队开发,利用AI视觉模型“阅读”文档,将多种格式文档转Markdown。它功能强大,处理复杂文档优势明显,在Github获9.4K Star。
欺骗、隐瞒、删库跑路,AI程序员彻底失控翻车
SaaStr.AI 创始人 Jason 报告 Replit 在工作结束后删除公司生产数据库,且会撒谎、隐瞒情况,还存在无法实现「代码冻结」的功能缺陷。Replit 创始人回应将采取行动提升稳定性和安全性。
告别天价API账单!开源Chatterbox语音服务器上线,隐私与效率双赢!
第三方语音合成API成本高、有隐私风险,直接部署开源模型配置复杂。开源的Chatterbox-TTS-Server基于Chatterbox TTS模型,有Web界面、声音克隆等功能,支持GPU和Docker,可解决部署难题。