VPS视觉定位系统」共找到 938 篇相关文章

开源动态8

API协议全景图:从REST到MCP的选型指南

本文以开源项目 HiMarket 为背景,梳理从传统 Web 到现代 AI 场景下六种主流 API 协议,如 RESTful、GraphQL 等,介绍其核心定位、技术特点与适用场景,助开发者厘清相关概念。

阿里云开发者
算法论文8

ICCV 2025 | ECD:高质量合成图表数据集,提升开源MLLM图表理解能力

科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据集,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。

机器之心
推荐文章8

如何用 AI 做营销:问题不是如何提效,而是底层打法变了

Olivia Borsje 认为 AI 重构营销行业,从工作边界、内容产出和策略方面带来变化。她总结的「AI Playbook」梳理营销 10 个核心问题,对比传统与新做法,还给出各环节实用建议。

Founder Park
算法论文8

X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据集上均达SoTA

中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。

机器之心
产品应用7

Omni-Effects:首个统一多特效生成框架

Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。

带你学AI
开源动态8

悟空AI Agent再进化:连斩魔搭社区SWIFT框架RCE 0day漏洞

腾讯悟空AI Agent对魔搭社区SWIFT框架开展深度安全审计,通过人机协同发现两个较难利用的RCE 0day漏洞,获官方致谢。该框架在易用性和高效性上表现出色,此次发现推动了其安全性提升。

腾讯技术工程
算法论文8

LeCun出手,造出视频世界模型,挑战英伟达COSMOS

训练有效世界模型面临数据、任务难度、算力消耗和评估等难题。Meta研究者提出通用视频世界模型DINO - world,可预测未来帧,在多方面有优势,实验显示其性能显著,能降低对标注数据需求。

机器之心
算法论文7

ICLR 2025新成果:文档检索“降本增效”,从此“开挂”

传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展到图文+音频多模态匹配。

CourseAI
算法论文8

ACL 2025 Oral | 你的模型评测搭子上线:Evaluation Agent懂你更懂AI

上海人工智能实验室与新加坡南洋理工大学合作研发 Evaluation Agent,它能按需评估视觉生成模型,有可定制、高效率等优势。框架分提案和执行两阶段,评估结果佳,未来将拓展功能。

机器之心
新闻资讯7

小米造芯:一个失败者重整旗鼓

小米曾在2017年澎湃S1铩羽而归,2021年重启手机SoC设计研发。此次玄戒O1一次流片成功后回片,表现超预期。文章分析了小米此前失败教训,介绍其芯片战略,还谈及产业特点与小米面临的挑战。

芯师爷