「点云视觉」共找到 1842 篇相关文章
GitHub 8k star!AI Gateway 如何帮你3行代码接入1600+ LLM,实现成本、可靠性与安全三赢?
Portkey AI Gateway是面向生产环境的开源AI Gateway,支持超1600款模型,通过1个API接口实现快速、可靠、安全的模型路由。它能解决产品开发和使用中的痛点,有统一API接口等核心功能。
让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni
openJiuwen社区发布业界最早工程化落地的多模态Skill范式Skill-Omni,让Agent经验从‘读得懂’升级为‘看得见’。它能将网页和视频视觉知识沉淀为多模态Skill,还介绍了生成及读取方式和适用任务。
19K star 霸榜,下一代的浏览器自动化神器!
做爬虫或Web自动化测试常因网页结构变动需重写脚本。Github上超火的Skyvern项目是基于浏览器的自动化代理,不依赖XPath或CSS选择器,用视觉识别结合大模型推理完成任务,已获19k+ star。
7B打败o3、GPT-5!医学AI智能体让模型学会“看哪里、怎么看”
上海创智学院LeapQuest团队联合多校,在ICML 2026接收两篇论文,提出“Think with Images/Think with Videos”范式,让视觉证据参与模型推理,Ophiuchus和MedScope分别用于图像和视频诊断,表现出色。
打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑
当前主流相机可控图像编辑基于图像扩散模型,应对连续相机运动易出现问题。近日,浙大联合哈佛发布UniGeo框架,在三核心层面注入统一几何引导,克服结构退化,提升视觉质量与跨视角一致性。
开源知识库,从 0 到上线,UltraRAG 企业知识库全流程实战 ,也许这是RAG最好的框架之一~~~
UltraRAG是基于MCP架构的轻量级RAG开发框架,核心设计工程友好。其3.0版强调推理可视化,适用于科研复现、企业知识库问答等场景,还介绍了使用方式,能解决RAG落地痛点。
硅谷热议:最快语音转文字模型
AI语音独角兽ElevenLabs发布Scribe v2 Realtime实时语音转文本模型,实现150毫秒超低延迟、93.5%高准确率,覆盖90多种语言,打破速度与精度不可兼得困境,此前该领域痛点多。
告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式
传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。
谷歌发布 Firebase Studio 重大更新,用于代理式 AI 开发
7月初谷歌伦敦云峰会上,Firebase Studio展示重要新功能,包括自主代理模式、对MCP原生支持及Gemini CLI集成,旨在简化代理式AI开发,让其更自主、信息丰富且融入开发流程。
实测Qwen-MT翻译模型,确实又快又好
阿里云百炼最新翻译模型Qwen-MT开放,有支持多语言互译、提供专业功能、轻量级架构等亮点。实测显示其响应快、回译准确、能调风格,200字文本仅需2.5秒。