「具身视觉」共找到 1599 篇相关文章
SeePhys Pro:重新审视多模态物理推理中的视觉理解与训练收益
来自中山大学等的研究者提出SeePhys Pro,是面向多模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。
重构线性视觉Transformer,精度与效率双平衡 | CVPR'25
南洋理工、北航与合工大联合提出CARE Transformer,以非对称解耦建模局部与全局,降低计算开销、提升特征表达。实验显示其在移动端低延迟高精度,打破“效率与精度不可兼得”困局。
谷歌、OpenAI同日发布模型,一个最快最具性价比,一个主打「人情味」
深夜谷歌和OpenAI相继推出新版本大模型Gemini 3.1 Flash - Lite、GPT‑5.3 Instant。前者专为大规模智能设计,性价比高、速度快;后者让日常对话更稳定实用,减少幻觉,提升了多方面表现。
2025 中国最具价值 AGI 创新机构 TOP 50 调研启动征集!
这一年AI在各领域发展迅猛,影响产业与社会底层逻辑。在此背景下,Founder Park发起调研,面向AI领域企业,聚焦AGI产业各层,从多维度评选50家创新机构,公布了各阶段时间安排。
创新中心| AI视觉创意不再拼“出图快”,而是拼“人味浓”?
北京AIGC视听产业创新中心位于朝阳区,是推动影视制作基地建设的举措。由多方参与,首创郎园运营,提供六大服务平台,截至2025年8月汇聚60余家伙伴。首创郎园拓展能力,项目延伸多地。
对话王小川:换个身位,做一家「医疗突出」的模型公司
百川智能创始人王小川与极客公园创始人张鹏长谈。百川曾快速扩张后调整,聚焦医疗。其新发布的医疗大模型Baichuan - M2性能优异,超OpenAI两开源模型。王小川认为造AI医生复杂,且AI家庭医生会比无人驾驶更早到来。
GPT-5:没有AGI,失望和天花板,最具竞争力的可能是定价
刚看完GPT - 5发布会,整体令人失望。发布会现错误图片,市场反馈不佳,专家认为开发仓促。它有三个型号,基础性能表现不一,在部分测试中不如竞品,亮点是价格有竞争力,代码能力受开发者好评。
千卡集群破壁之道:vivo视觉多模态大模型训练效率跃迁实战
多模态大模型在多领域需求增长,但千卡级 GPU 训练挑战大。vivo AI 架构师王兆雄在大会演讲,结合 LLaVA 和 DiT 模型实践,解析优化策略,分享提升训练效率与稳定性的经验,还展望了 AI Infra 未来。
CVPR 25 |全面提升视觉感知鲁棒性,生成模型快速赋能三维检测
香港中文大学(深圳)等单位学者提出 DriveGEN 无训练自动驾驶图像可控生成方法,无需额外训练生成模型,通过两阶段策略扩展训练数据,提升三维检测模型鲁棒性,代码已开源。