「视觉空间」共找到 1095 篇相关文章
用3万小时触觉数据补齐具身智能「手感」,新智具身联合复旦大学统一触觉「方言」
新智具身联合复旦大学发布三份技术报告,将触觉跃升为具身智能核心基建。构建3万小时交互语料库统一触觉“方言”;提出新方案让机器人提前预判触觉;在世界模型中重构“触觉想象”,推动具身智能“视触融合”。
Fable 5被网友薅出省钱神招!最高减70%!
网友发现把Fable 5上下文转成图片,让模型通过OCR读取,token输入成本最多省70%。方法pxpipe在GitHub获3000+STAR,本质是本地代理,还引出谷歌老论文及DeepSeek - OCR相关技术。
看屏幕、用键鼠,我的 OpenClaw「睁眼」了
2026年5月11日,OpenClaw上线macOS桌面操控工具Peekaboo,提供像素级截图、UI元素识别和GUI自动化能力。它打破Agent局限,可接管桌面操作,部署简单,普通人也能用,还有安全保障,但也存在坐标偏移等问题。
The Batch: 952 | GPT-5.5 性能领先,但幻觉问题突出
OpenAI 最新旗舰模型 GPT-5.5 是闭源视觉 - 语言模型,在重要基准测试中表现领先,但在区分已知未知内容上有困难,幻觉问题突出,在主观评估中落后于对手。
最新!Demis Hassabis:Agent才刚刚开始,AI下一步是创造虚拟细胞
DeepMind掌门人Demis Hassabis在专访中谈到AGI发展,认为当前技术距AGI可能差一两个大突破,预计2030年左右实现。还探讨了记忆、Agent、推理等问题,提及开源、多模态等情况,展望了生物领域虚拟细胞等。
ACL 2026 | LCA:DeepSeek 长文本加速神器,90% KV 缓存缩减 + 2.5 倍推理提速
琶洲实验室等团队提出潜在空间压缩注意力(LCA),入选 ACL 2026。LCA 突破传统注意力机制瓶颈,适配不同大模型,降低硬件门槛与成本,提升推理效率。论文与代码已开源。
大基金投资,安徽又跑出一家芯片IPO
4月10日,全芯智造IPO辅导状态更新为“辅导验收”。这家成立不到七年的制造类EDA企业,创始人是行业“老兵”倪捷,技术覆盖制造关键环节,虽营收破5亿但净亏超3亿,获大基金等投资,有望推动国产替代。
2026年,前端、后端、客户端程序员的职业生涯,该推倒重来了
文章指出AI重塑软件行业价值链,多数程序员工作集中在易被AI替代的实现层和维护层。前端、后端、客户端面临不同冲击及转型路径,还给出转型框架和建议,提醒程序员主动转型。
中大 × MBZUAI重磅开源!A₁:全透明高效 VLA 模型,机器人实时控制成本直降 76% 丨CVPR 2026 Findings
开放世界机器人操作被大模型算力成本和推理延迟难题困住,中大与MBZUAI团队推出全开源的A₁模型,其自适应推理方案降低推理延迟和骨干计算量,性能超主流基线,打破‘高性能=高成本’魔咒。
融资千万的 Violoop ,要做中国版的「硬件龙虾」
AI科技公司Violoop创始人何佳霖,想做中国版“硬件龙虾”,让AI 24小时为人类打工。其产品是手掌大小桌面硬件,3月12日完成数千万元融资,将用于产品落地等。团队最初尝试纯软件路线,后因安全等问题转向硬件。