「动态物体操控」共找到 507 篇相关文章
分割一切并不够,还要3D重建一切,SAM 3D来了
深夜 Meta 重大更新,上线 SAM 3D、SAM 3。SAM 3D 含物体与场景重建、人体形状与姿态估计两模型,能将 2D 图转 3D 重建结果。SAM 3 可检测、分割与跟踪图像视频物体。Meta 开放模型权重与代码,推体验平台。
Relink:为GraphRAG动态构建证据图
大语言模型在开放域问答中有‘幻觉’问题,GraphRAG结合LLM与知识图谱缓解此问题,但现有方法有缺陷。作者提出‘推理并构建’新范式和Relink框架,实验显示其性能领先,对RAG系统设计有启示。
腾讯发布Hunyuan-GameCraft!从静图进入动态游戏世界
近年来,现有方法难满足游戏视频生成需求。腾讯推出Hunyuan - GameCraft,可基于一张图像和提示词生成游戏交互视频,能精准响应交互信号,保留历史场景信息,不过动作空间待丰富。
ECCV 2026 | 一段视频,重建一个可仿真的动态世界
机器人走出实验室后,训练数据需覆盖真实世界情况。OVOW由多团队完成,被ECCV 2026接收。它从单目视频出发,输出可编辑、可碰撞的实例级Mesh,串联视觉基础模型完成流水线工作,能用于物理仿真。
OpenAI:人&AI对齐技术应该是一个动态、双向的循环
在NeurIPS 2025上,NYU&OpenAI就Human - AI Alignment发布Tutorial。指出当前对齐像打地鼠,根源是将其当成静态、单向的,提出HAA框架,强调多元目标、人类全链路话语权及社会 - 技术系统量化监督。
人格向量:大模型性格的数学解码与精准操控
大语言模型在应用中会出现危险行为偏移与训练引发的非预期偏移,传统方法难监控干预。本文发现人格特质在线性方向表现为“角色向量”,实现提前预测、实时监控和主动控制,为AI安全提供数学框架。
moltbook爆火背后:人类操控?伪造截图?Karpathy发风险提醒
moltbook是专为AI设的社交平台,超150万个AI Agent活跃。有人认为它是突破,也有人觉得只是娱乐展示。其背后或有人为操纵,还藏风险。Karpathy既肯定其规模,也提醒有网络效应和安全问题。
3D领域的NanoBanana也来了,万物皆可用嘴操控。
3D领域的hyper3D推出Rodin Gen - 2,是首个能用嘴编辑3D模型的AI 3D产品。用户可上传三方模型修改编辑,还能图生3D。用嘴改3D能做局部可控修改,适合专业生产管线。
“心内推理”:一种动态多模态潜在空间推理范式 | 直播预约
当前多模态大模型推理效率低、稳定性不足。本次分享将介绍DMLR,它无需额外训练,仅在推理阶段生效,通过在潜空间优化潜在思考token、引入关键视觉信息,实现高效稳定的多模态推理。
推理路径的动态调控:让大模型学会“恰到好处”的思考
当前大模型推理路径存在冗余问题,本文提出测试时提示干预框架PI(π),通过《When/How/Which》三模块协同,将人类专家经验融入推理过程,在多个STEM基准测试中缩减推理步骤、提升准确率。