「视频智能体」共找到 4297 篇相关文章
上交大智能计算研究院论文:不只算对答案,大模型如何真正学会运筹建模丨ICLR 2026
上海交大智能计算研究院提出 StepORLM,通过生成式过程监督提升运筹建模可靠性。研究反思传统训练范式局限,在多数据集测试中,小参数的 StepORLM 表现超大型模型,还分析现有方法缺陷并提出解决框架,有重要方法论和应用意义。
独家丨清华00后团队「零次方机器人」获超亿元融资,聚焦可真实落地的具身智能
AI科技评论独家消息,零次方机器人近日完成超亿元融资,由润泽集团领投。该公司由清华00后创办,团队超百人。已实现单月量产百台,订单破亿,推出具身操作基础模型,融资将用于软件、硬件和生态建设。
机器人视觉语言导航进入R1时代!港大联合上海AI Lab提出全新具身智能框架
香港大学与上海AI Lab联合提出VLN - R1,可将自然语言指令转化为连续导航动作,打破传统链条。它有两阶段训练等创新支柱,在测试中表现出色,小模型性能佳,推动具身智能从数字向具身认知跨越。
具身智能算法哪家强?RoboChallenge见真章!全球首个大规模真机算法评测平台来了
Dexmal原力灵机联合Hugging Face推出RoboChallenge项目,它是全球首个大规模、多任务的真实物理机器人基准评测平台。该平台创新采用‘远程机器人’架构,有30项真实任务基准集等,已验证多种算法表现。
美团面试题:如何设计多轮对话智能客服Agent。评论区吵翻了,但答案可能就一句话。
文章围绕美团面试题,探讨如何设计多轮对话智能客服Agent。指出AI Agent核心是Context Engineering,介绍业内架构,强调给AI不同容忍度、分步骤处理复杂问题,还提及解决体验问题,认为产品要知边界。
火爆全网的《卢浮宫小猫》AI视频万字创作心得分享,这可能是他们最毫无保留的一次。
数字艺术家海辛和阿文分享《卢浮宫小猫》AI视频全流程创作心得,从选角、定调、音乐、分镜、美术到动画等环节,还提及废稿情况,强调模型便捷不应成偷懒理由,要把作品做得更好。
ICML 2026 Oral | 为3D空间智能数据构建全自动数据飞轮,Holi-Spatial打造400万级空间多模态数据集
来自多机构的研究团队提出 Holi - Spatial,可从原始视频自动生成 3D 重建等数据,构建 400 万级空间标注数据集 Holi - Spatial - 4M,提升 VLM 空间能力,还形成自动化数据飞轮,但存在计算成本高、特定场景表现不佳等局限。
PITT | 提出PhyT2V框架:让文生视频(T2V)更符合物理规律(CVPR2025)
当前T2V技术迈向推理驱动阶段,物理规律是关键约束。匹兹堡大学团队提出PhyT2V框架,不依赖模型重训练或大规模外部数据,可增强主流T2V模型能力,有低落地门槛和良好泛化性。
让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准
上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。
Light-X来了!全球首个「镜头×光照」双控4D视频生成框架,单目视频秒变电影级
新加坡南洋理工大学等科研机构联合推出Light - X,全球首个「镜头×光照」双控4D视频生成框架。它解耦相机与光照,在扩散模型中融合,还构建Light - Syn数据管线,实验显示其效果显著优于现有方法。