视觉解决方案」共找到 754 篇相关文章

新闻资讯8

两张图定位全球,o3碾压T0级高手!人类「诡计」被看穿,跨模态推理爆表

OpenAI的o3在GeoGuessr游戏中与大师级玩家Sam Patterson对决,o3通过视觉与搜索推理,忽略伪造EXIF信息,最终以23179比22054获胜,展现出跨模态推理潜力,引发对AI推理能力的思考。

新智元
算法论文7

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

视觉 - 语言 - 动作模型(VLA)是机器人操作重要基础模型,但复杂任务成功率低,真机强化学习成本高。微软等机构研究者提出 UniSteer,将人类纠正转换成噪声监督,在多任务测试中提升了成功率。

机器之心
产品应用8

AI 产业终于等来了自己的“支付宝时刻”

本周支付宝发布面向 AI Agentic Commerce 的全栈支付解决方案。该方案含信任基座、收付引擎、AI 钱包助手和 Token Pay,解决支付安全、收付款及管控等问题,推动 AI 产业从工具走向商业循环。

MacTalk
8

Claude能直接操控你的电脑微信了,这才是真正的上位小龙虾。

Claude新发更新,可通过Computer use纯视觉方案操控电脑,还更新了远程操控Dispatch。这俩功能组合让Claude能操控微信等本地软件,使用简单,且权限管控和防护较好,更新速度快,领先同类产品。

数字生命卡兹克
算法论文8

打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26

现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。

量子位
产品应用8

基于 Qwen3-VL-Embedding-8B 实现文搜图语义内容检索的实战教程

文章围绕Qwen3-VL-Embedding-8B模型展开,介绍其核心特性、技术架构等,提供环境搭建、模型部署指南,给出文搜图系统架构及代码实现,还通过电商、社交媒体、企业文档三个实战案例展示应用,最后讲解性能优化与常见问题解决方法。

机器学习AI算法工程
产品应用7

给 OpenClaw 接上钉钉之后,我的龙虾终于把生产力拉满了

作者在深圳做OpenClaw线下Workshop时,发现国内用户用Telegram与它对话不便。后找到接入钉钉的解决方案,介绍了接入原因、配置教程,还分享用其监控AI热点和做竞品分析的使用体验。

特工宇宙
产品应用8

对话 Seede AI:帮人类创作只是第一步,我们想帮人类理解 Agent 产出的内容

本文对话 Seede AI 创始人 Longyi,探讨 AI 设计产品发展。Seede AI 主打将原始素材转化为可交付设计稿,易上手、受众广。创始人认为不转向 AI - Native 没救,产品已跑通 PMF,目标是帮人类理解 Agent 产出内容。

Founder Park
产品应用8

Win版Claude Cowork杀疯了!140元雇个全职AI员工,全网首测真香

昆仑万维推出天工Skywork桌面版,专为Windows打造,能调用Claude和Gemini。实测显示,它可高效分类文件夹、提取图片、生成报告等。相比Claude Cowork,其在生态、视觉、模型等方面有优势,还降低了办公门槛。

新智元
开源动态8

蚂蚁具身智能明牌了:做大脑,和宇树们错位竞争

蚂蚁灵波开源具身智能基座模型LingBot-VLA,用20000小时真实世界数据训练,解锁最大规模开源真机数据之一。它性能超国际顶尖模型,还指明通用具身智能发展路径,为行业提供全栈解决方案

量子位