「通用视觉感知系统」共找到 1584 篇相关文章
多模态模型具备“物理推理能力”了吗?新基准揭示:表现最好的GPT-o4 mini也远不及人类!
来自多机构研究人员构建PhyX基准测试,评估多模态模型物理推理能力。测试显示,即便表现最佳的GPT - o4 mini准确率仅45.8%,远不及人类的75.6%,且模型在多方面存在结构性缺陷。
OpenAI很看好!首个SWE-1模型发布,软件开发或将提速99%
Windsurf发布首个前沿模型SWE-1,目标将软件开发提速99%。它不只能写代码,还能协助软件工程流程。有三个系列模型,SWE-1运行成本低,SWE-1-lite对所有用户开放,SWE-1-mini适用于低延迟场景。
“烧掉94亿个OpenAI Token后,这些经验帮我们省了43%的成本!”
作者以月耗94亿OpenAI Token实战经历,分享优化成本经验,如选对模型、用提示词缓存、设账单预警等,降低成本43%,不过网友对此有不同看法。
全公司禁用Claude Code,CEO放狠话逼宫A社!
Shopify CEO Tobi Lütke考虑禁止公司使用Claude Code,除非其支持读取AGENTS.md和.agents/skills。Claude Code团队称正在改进,但坚持自有体系。AGENTS.md获众多工具支持,A社是相关基金会创始方,Claude Code却未原生支持。
起猛了,机器人开上卡丁车了!
Symbiosis Robotics放出机器人开卡丁车新演示,还推出Direct Perception Control(DPC)。它取消中间运动表示,让模型结合画面、任务和身体反馈直接算关节与手部目标,团队还整理15,010小时具身数据。
世界模型再迎新突破,兔展智能UniWorld-View登顶WorldScore榜单
近年来,世界模型成视觉 AI 重要研究方向。兔展智能联合研发的 UniWorld - View 登顶 WorldScore 榜单,完成昇腾算力适配与开源。它聚焦让 AI 理解未拍摄世界,解决了诸多技术难题。
用3万小时触觉数据补齐具身智能「手感」,新智具身联合复旦大学统一触觉「方言」
新智具身联合复旦大学发布三份技术报告,将触觉跃升为具身智能核心基建。构建3万小时交互语料库统一触觉“方言”;提出新方案让机器人提前预判触觉;在世界模型中重构“触觉想象”,推动具身智能“视触融合”。
Fable 5被网友薅出省钱神招!最高减70%!
网友发现把Fable 5上下文转成图片,让模型通过OCR读取,token输入成本最多省70%。方法pxpipe在GitHub获3000+STAR,本质是本地代理,还引出谷歌老论文及DeepSeek - OCR相关技术。
探访性爱机器人公司Somnia Lab:卧室里的性与AI|甲子光年
本文探访了性爱机器人公司Somnia Lab,其创始人Xara坦诚表示在研发能和人类亲密互动的机器人。公司已完成三轮融资,产品‘硅姬’将入市,‘硅君’预计2027年面世,公司规划独特,技术有突破,试图变革行业。
看屏幕、用键鼠,我的 OpenClaw「睁眼」了
2026年5月11日,OpenClaw上线macOS桌面操控工具Peekaboo,提供像素级截图、UI元素识别和GUI自动化能力。它打破Agent局限,可接管桌面操作,部署简单,普通人也能用,还有安全保障,但也存在坐标偏移等问题。