「开源视觉模型」共找到 9129 篇相关文章

产品应用7

已经狂揽了15.2k!Cursor 的开源平替 Void 来了!

今天介绍新工具 Void,它是开源的 Cursor 和 GitHub Copilot 替代品,完全免费。拥有强大编程功能,可直连 AI 模型,基于 VS Code 开发,对其用户友好,还介绍了上手、构建等方法。

GitHubStore
算法论文8

刚刚,加入腾讯的姚顺雨发表首篇Paper~

腾讯混元与复旦联合发表论文《CL-bench》,姚顺雨署名并全面细致审阅反馈。CL-BENCH 首次单独考‘现学现卖’,有独特设计原则、四大题型,其评分杜绝‘差不多’,还让 10 个前沿模型‘翻车’。

PaperAgent
算法论文8

轻量高效,即插即用:Video-RAG为长视频理解带来新范式

现有视觉语言模型处理长视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多模态辅助文本检索增强生成,解决长视频理解问题,适用于多场景。

机器之心
产品应用7

Anthropic试图彻底杀死Harness Engineering。

Anthropic推出新产品Managed Agents,定位是帮用户做Harness。它指出Harness保鲜期短,自己维护不划算。技术上把Claude Agent SDK拆成三块,让Harness成可热插拔模块。不过通用Harness有局限,开源社区也有新路线。

探索AGI
新闻资讯8

黄仁勋罕见长文:AI是一个五层蛋糕

黄仁勋认为AI是由能源、芯片、基础设施、模型、应用组成的五层蛋糕,是像电力、互联网一样的基础设施。目前AI建设刚起步,虽已产生经济价值,但大部分基础设施、劳动力、机会待实现。

AI寒武纪
新闻资讯7

鹅厂门口免费装龙虾,几百人排爆了!一代人有一代人的鸡蛋要领

腾讯云工程师在鹅厂门口免费为几百人安装OpenClaw,提供“从装到玩”服务。OpenClaw是开源智能体框架,像“龙虾”,可自动操作电脑。目前GitHub Star数超27.04万,多家公司跟进。

量子位
开源动态7

像原始人一样和AI对话,费用可直接砍掉40%

开源项目‘caveman-compression’能帮使用ChatGPT API或其他大模型的用户省钱。原理是删废话留关键信息,有调用OpenAI和本地NLP两种压缩方式,不同场景省钱效果不同,还介绍了使用方法。

AI工程化
开源动态8

给你家 AI Agent 装个「长期记忆」,这个开源库一行代码搞定

Memori是开源的LLM记忆引擎/Python库,为聊天机器人等提供统一长期记忆层。它功能亮点多,如自动记忆分类、精准召回等,集成成本低,还有进阶玩法和企业安全能力。

小华同学ai
开源动态8

Meta开源多语言语音识别系统,支持1600种语言,可轻松扩展新语种!

Meta研究团队开源Omnilingual ASR,能理解1600种语言,用几条语音 - 文本配对样本就能零样本扩展新语种。提供三种架构,满足不同需求,性能超现有多语种模型,应用场景广泛。

开源星探
开源动态8

项目在GitHub上已获得约3600+star,探秘 ChatDoctor:LLaMA 微调后的 AI 医生,真能在线问诊?

现代医疗资源不均、问诊效率低,ChatDoctor应运而生。它基于LLaMA微调,有医学对话微调等亮点,技术优势多,适用于在线问诊等场景,与同类对比优势明显,开源助力医疗对话模型发展。

小华同学ai