「帧级动作控制」共找到 754 篇相关文章
Meta扩张继续!挖走OpenAI 2名多模态AI研发人员,收购语音初创公司PlayAI
据报道,Meta 首席执行官扎克伯格从 OpenAI 挖走 2 名多模态 AI 研发人员,还完成对语音初创公司 PlayAI 的收购。Meta 近期在 AI 人才争夺上攻势猛,想补足短板,其超级智能团队未来表现值得关注。
OpenAI员工爆料:已抢先体验GPT-5!7月上线,疑似完全多模态
新智元报道,X上神秘爆料与网友灰度测试经历让GPT - 5讨论再升温。奥特曼称今年夏天可能推出,迈向完全多模态。此外,还提及OpenAI核心团队动态、出走高管新动作及AI发展风险与监管建议。
“甲方快乐模型”诞生,拿下平面设计新SOTA!多条件一键生成,还能独立调整元素 | 复旦&字节
复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、多模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在多维度评估基准上表现出色,还支持多轮编辑。
让AI像人类一样认知真实世界!UCLA谷歌强强联手,长时记忆+3D空间理解超越基线16.5%
如何让AI在3D环境中像人类一样思考,是具身智能领域难题。UCLA与谷歌团队带来3DLLM - MEM模型与3DMEM - BENCH基准,让AI有构建、维护和利用长时记忆能力,实验超基线16.5%,但有依赖模拟器预设的局限。
SSM+扩散模型,竟造出一种全新的「视频世界模型」
在AI热词不断涌现的时代,斯坦福大学等机构研究将长上下文、状态空间模型、扩散模型等结合,创造全新「视频世界模型」。它用状态空间模型实现长期记忆,还设置局部注意力机制,训练和推理表现出色。
波士顿动力机器人进厂打工现逆天操作!3D感知+实时追踪,人类捣乱完全不带怕的
波士顿动力的Altas机器人重磅升级,具备3D空间感知和实时物体追踪能力,可自主执行复杂工业任务。文章还解析其背后技术,包括2D感知、3D感知、物体位姿估计和校准等,团队未来将构建统一基础模型。
社交Agent: 通过RL学习自适应Thinking,根据场景在“秒回”和“深思”间灵活切换
现有聊天机器人在人情世故场景表现不佳,论文指出大模型思维‘一根筋’。研究团队设计4种思维模式,用AMPO强化学习算法动态切换。在模拟社交任务中,AMPO表现超GPT - 4,省时高效。
OpenAI大变革!继续与微软等,以非营利模式冲击AGI
今天凌晨2点,OpenAI宣布继续由非营利组织控制,营利性实体转变为公共利益公司。此前转型营利性公司引发争议,此次调整是听取各界意见后做出,旨在让AI造福全人类。
OpenAI有个神秘邮箱,多大点事都能惊动奥特曼
OpenAI扩张中启用friction机制,员工遇问题可发邮件到friction@openai.com,重要问题能惊动高层。该机制由Fidji Simo制度化,虽有人不满,但在竞争中利于消除内部堵点,对手也各有管理法。
全球首个跨本体、跨视角、多模态物理世界模型,CurrentWorld-0 来了!
Current Robotics 发布跨本体、多模态物理世界模型 CurrentWorld-0,它从真实数据学规律,整合跨本体、多视角和力触预测,可评测机器人,解决动作可控性等问题,让评测成训练数据入口。