「开源视觉模型」共找到 9135 篇相关文章

产品应用8

记忆奇点来临!人类三十万年遗忘被哈佛神经科学家终结

哈佛医学院神经科学家 Gabriel Kreiman 推出 Engramme,旨在赋予人类完美且无限的记忆。它能在特定场景下主动推送相关记忆,构建了大记忆模型,有深厚研究积累,已开放 beta 版申请。

AGI Hunt
开源动态7

112个OpenClaw预建技能,让你的“龙虾”变成全职管家

开源项目 ClawFlows 为 OpenClaw agents 配备 112 个预建「技能包」,安装和启用简单,覆盖智能家居、日程管理等多领域。工作流以 markdown 文件呈现,支持多种语法,可修改分享,但有使用限制和质量差异。

AI工程化
开源动态7

中途退学的艺术生,开发Web 3D项目,周下载量破400万

近日,Three.js 官方公布其周下载量突破 400 万。它是基于 WebGL 的 JavaScript 3D 图形库,承担诸多 Web 页面核心 3D 渲染工作。AI 降低其准入门槛,其创始人成长经历独特,开源风格克制。

机器之心
算法论文8

DeepSeek又又又又发新论文了!这一次,他们重构了AI看图的方式

DeepSeek发布论文DeepSeek - OCR 2,指出传统AI看图方式有误,提出视觉因果流概念。其两阶段级联推理解法效果显著,还可能整合进即将发布的DeepSeek V4,有望实现原生多模态。

花叔
产品应用7

全网刷屏爆火的Clawdbot到底神在哪?我花了24小时,这是你需要的全部真相。

Clawdbot是爆火的个人桌面AI助理,可在手机远程操控,赋予Claude等模型本地执行权限。它开箱即用,有进阶玩法,但开发有风险、成本高,适合繁琐工作多的人。

开源AI项目落地
产品应用8

你奶奶也能看懂:DeepSeek-OCR的秘密。

本文介绍DeepSeek-OCR,它并非普通OCR工具,而是用“上下文光学压缩”将大量文本信息转为少量视觉Token。其架构含编码器和解码器,压缩效果惊人,重新定义AI“记忆”,或改变AI认知方式。

AI大模型应用实践
推荐文章8

Manus:3大核心策略,破解AI Agent上下文膨胀难题

当AI Agent调用工具结果大量涌入上下文窗口,LLM性能会下滑。Manus联合创始人拆解其上下文工程逻辑,给出‘减少、卸载、隔离’三大策略及模型选择等方法,还提炼出6条实践启示。

CourseAI
新闻资讯7

谷歌月Tokens消耗量领跑全球了:1300000000000000(别数了是千万亿)

谷歌月处理Tokens用量达1.3千万亿,较一年前的9.7万亿大幅增长。横向对比,谷歌在该指标上远超微软等大厂。Tokens消耗量可衡量模型多方面能力,谷歌为行业树立新标杆。

量子位
算法论文8

低Token高精度!字节复旦推出自适应推理框架CAR

字节与复旦大学研究人员提出自适应推理框架CAR,能根据模型困惑度动态选短答或长推,在多基准测试中平衡了准确性与效率,打破长文本推理必然性能更好的认知。

量子位
算法论文8

让机器人学会「预判接触」:它石智航牵头四大顶尖机构发布TacForeSight,破解精细操作难题

它石智航联合四大顶尖机构发布论文 “TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation”,提出力条件触觉世界模型,让机器人能提前预判接触变化,在真机验证中性能优异。

机器之心