「纯视觉感知」共找到 994 篇相关文章
空间智能率先落地国民APP!实测:时空决策很顺滑,直达千人N面出行体验
空间智能虽前沿,但在有场景和业务优势时能快速落地。高德地图2025版内测,其“小高老师”智能体按需提供出行和生活建议,AI导航有超视距感知能力,是迈向空间智能的国民APP。
蚂蚁具身研究首次亮相!就解决了机器人「看」透明玻璃这些难题,还开源了
蚂蚁灵波科技开源高精度空间感知模型 LingBot-Depth,针对性解决机器人识别真实世界的「玻璃问题」。其构建双线并行数据集,提出掩码深度建模思路,在深度补全等任务中表现出色,且已具备落地能力。
CoT 之后,CoF 如何让帧间逻辑从「隐式对齐」变成「显式思考」?
CoT 虽提升语言模型推理能力,但在 C 端场景有局限,且被质疑并非真实推理。视觉领域提出 CoF 概念,Google DeepMind 团队引入理论,让视频模型通过帧链推理提升帧间一致性,还具强大泛化能力。
10 人 1600 万美金 ARR,华人团队 OpenArt 用了这 11 个 AI 技术栈
华人团队 OpenArt 10 人团队做到 1600 万美金 ARR,CEO Coco Mao 分享经验。包括找准定位,聚焦三类核心用户;用程序化 SEO 实现增长;战略转型做视觉故事讲述;解决角色一致性问题,还介绍多方面技术栈。
登上NeurIPS,Genesis开创无需OCC引导的多模态生成新范式,在视频与激光雷达指标上达到SOTA水平
华中科技大学与小米汽车提出多模态图像 - 点云联合生成框架Genesis,采用两阶段架构和DataCrafter模块。在nuScenes数据集实验显示,其在视频与激光雷达指标达SOTA水平,还提升了下游感知任务效果。
Apple发布新SOTA Manzano:混合Tokenizer破解多模态统一难题,理解与生成双翼齐飞
多模态AI前景广,但现有模型在理解和生成任务上存在性能冲突。苹果提出Manzano模型,用混合视觉标记器降低任务冲突,结构简单可扩展,在多基准测试达SoTA水平,还展示图像编辑潜力。
视听分离SOTA提速6倍!清华发布首个6M高性能模型|ICLR'26
清华大学团队推出Dolphin模型,仅用6M参数,通过离散化视觉编码和热扩散注意力机制,实现单次推理精准分离语音,速度提升6倍以上,在多项基准测试中刷新纪录,为端侧设备部署开辟新路。
面壁小钢炮 VoxCPM-TTS:开源端到端 TTS,轻量高效低延迟
面壁提出基于扩散自回归建模的端到端语音生成模型 VoxCPM,构建于 MiniCPM - 4 之上。它克服传统离散 token 方法缺陷,实现语义与声学特征解耦,有上下文感知语音生成和零样本语音克隆能力,低延迟。
Karpathy 评 DeepSeek-OCR:分词器必须消失!马斯克:光子才是 AI 的终极语言
Andrej Karpathy 发长文讨论 DeepSeek - OCR 论文,提出图像输入比文本更高效,还表达对分词器的厌恶,认为其必须消失。马斯克称 AI 主要交互将是视觉。开发者分享实践经验,也有人提出质疑。
马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?
Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。