「第一人称视频助手」共找到 1359 篇相关文章
ChatGPT推出即时结账,比Claude发布重要得多
OpenAI宣布在ChatGPT推出即时结账功能,用户可在聊天界面直接购买,首批合作商家有Etsy,Shopify超百万商家将加入。由ACP驱动,是开源标准。资本市场反应好,社区反应不一,这标志AI助手向交易平台转变。
全新唇同步技术OmniSync,遮挡,侧脸不在话下
唇同步对创建逼真视频内容很重要,但现有方法在身份一致、姿势变化等方面有局限。中国人大携手快手提出OmniSync,引入无需掩膜的训练范式,保证身份和姿态一致,能适应复杂场景,还建立AIGC - LipSync基准。
7B打败o3、GPT-5!医学AI智能体让模型学会“看哪里、怎么看”
上海创智学院LeapQuest团队联合多校,在ICML 2026接收两篇论文,提出“Think with Images/Think with Videos”范式,让视觉证据参与模型推理,Ophiuchus和MedScope分别用于图像和视频诊断,表现出色。
Clawdbot再次更名:新名OpenClaw,官宣支持Kimi K2.5和小米MiMo
两个月前Peter Steinberger搭建的项目,最初叫WhatsApp Relay,现获超10万GitHub星标、单周200万访问者。1月29日正式更名为OpenClaw,它是开源AI助手平台,此次发布新渠道、支持新模型等。
内容娱乐新风向:这群创业者靠多模态 AI 玩出了新花样
12月23日,「MASHANG DEMO TO DAILY」第二期活动在杭州开启,展示多模态AI探索成果。6位创业者分享精华内容,涉及游戏开发、虚拟社区、视频创作等领域,探讨多模态AI产品价值与发展方向。
AI Agents,年中总结!
文章梳理6月旧金山AI Engineering World's Fair重磅分享,指出AI Agent发展方向是成为自主处理复杂工作的助手,还介绍了Ambient Agents崛起、Agent UX设计两派观点、训练进入RL时代等关键趋势。
中国机器人手机火爆MWC!老外快门按得根本停不下来
2026年MWC巴展上,荣耀推出的机器人手机Robot Phone引发关注。它有外接云台摄像头,能全角度AI视频通话、互动拍摄,还可结合旗下人形机器人联动。其结构压缩,AI能力强,打开了手机设计新思路。
SIGGRAPH Asia 2025|30FPS普通相机恢复200FPS细节,4D重建方案来了
3D视觉领域难题是用普通摄像机将高速世界转为数字化4D时空。受限于成本和带宽,现有方法有局限。本文提出“异步采集 + 视频扩散模型修复”方案,用30 FPS相机恢复100 - 200 FPS动态细节。
刚刚,北大校友Lilian Weng自曝公司首个产品?一篇论文未发,估值却已90亿
OpenAI前安全副总裁Lilian Weng疑似曝光90亿估值新公司Thinking Machines首个产品——手动调参仪表盘,训练中可手动调超参数。OpenAI也有AI硬件野心,设想让ChatGPT成全能硬件助手。
告别噪声初始化:NTU MARS Lab提出A2A新范式,实现机器人高性能单步动作生成
新加坡南洋理工大学 MARS Lab 提出 Action-to-Action (A2A) Flow Matching 新范式,以历史机器人轨迹为生成起点,打破生成速度与精度瓶颈,在训练效率、推理速度及泛化表现上佳,还可扩展至视频生成领域。