「图像思考」共找到 1067 篇相关文章
李想重画具身智能
理想汽车在成立的十一年里,擅长将复杂技术与家庭出行需求对齐。2026年,理想不再满足于打造更好的家庭车,提出造能感知、思考、行动、反馈的硅基生命体。李想提出具身智能上下半场论,理想重构研发体系,以造人方式造车。
VLA不够了?触觉,将改写具身智能新格局
2026 年数据成具身智能竞赛焦点,IEEE 专访机器人学家王煜。他认为 VLA 架构难支撑机器人落地,触觉数据是关键。他与团队提出 VTLA 框架,创立戴盟机器人,发布数据集并开源部分数据,还阐释对具身智能多方面的思考。
从大厂设计师到超级一人公司:6000字回顾我和AI的2025
作者回顾2025年,身份从大厂设计师变为自由职业者,用AI加持做超级一人公司。自媒体上各平台粉丝量增长,开始做视频;社群活动帮创业者和会员;创作涵盖Vibe Coding、Agent、图像视频等;还介绍合作产品,展望2026年AI趋势。
硅谷今夜学中文!Cursor被曝「套壳」国产,AI顶级人才全是华人
新智元报道,硅谷AI圈现神奇现象,不会中文难进核心团队。海外模型频“偷师”国内开源模型,如Cursor的Composer思考时说中文,Windsurf用GLM-4.6微调。国内开源模型量大管饱、性能好还便宜,能力稳居第一梯队。
3D-R1重塑三维视觉语言推理!让三维交互更智能
近年来,视觉 - 语言模型在2D图像理解有突破,但3D视觉语言模型面对复杂场景不足。为此上海大学团队提出3D - R1模型,它基于新数据集和策略构建,有强多任务三维理解能力,不过也存在进步空间。
具身智能的「Z 世代」,来了
文章与三位具身智能领域的Z世代年轻人对话,他们有不同背景和经历。谭恒楷研究机器人,提出创新模型和算法;吴铭东专注真机强化学习;王乾旭研究蒸馏特征场。他们对AI有独特认知,展现出年轻人的冲劲和思考。
分割一切并不够,还要3D重建一切,SAM 3D来了
深夜 Meta 重大更新,上线 SAM 3D、SAM 3。SAM 3D 含物体与场景重建、人体形状与姿态估计两模型,能将 2D 图转 3D 重建结果。SAM 3 可检测、分割与跟踪图像视频物体。Meta 开放模型权重与代码,推体验平台。
也许,该庆幸在这个时代被裁员
文章借一位失业者基于AI做产品的感慨,引出对GPT - 5发布的讨论。GPT - 5升级后被中外用户吐槽没人味,OpenAI 24小时内恢复GPT - 4o访问权限,还推出三种响应模式,这引发了对AI与人关系的思考。
3D VLA新范式!CVPR冠军方案BridgeVLA,真机性能提升32%
中科院自动化所提出BridgeVLA模型,将3D输入投影为2D图像并利用2D热图进行动作预测。它训练分两阶段,在多仿真基准和真机实验表现卓越,仅3条轨迹基础任务成功率达96.8%,真机性能提升32%。
AI 取代不了放射科医生
人们曾认为AI图像识别技术会让放射科医生被淘汰,如杰弗里·辛顿预言应停止培训该类医生。但过去十年,放射科医生需求反而增加。文章以其为例,分析AI难取代的原因,如基准测试局限、医生工作复杂、AI落地困难等。