参考图像转视频」共找到 1473 篇相关文章

算法论文8

EMNLP2025 | 解耦视觉与推理,港大探索视觉语言模型"眼智分离"新范式

当前大视觉语言模型处理复杂推理任务时,常过分依赖语言知识,忽视图像关键信息。港大等团队提出ProReason框架,其蒸馏的ProReason - VL和ProReason - Q3模型性能提升显著,为LVLMs发展提供方向。

深度学习自然语言处理
产品应用7

再也不怕面瘫脸!YouTube黑科技:AI帮你「永久微笑」,连僵尸都咧嘴笑

YouTube在Shorts相机里实现AI实时「重绘」人脸,效果自然。它通过知识蒸馏将大模型「瘦身」成小模型,用迭代蒸馏打磨细节,PTI保证身份特征,MediaPipe搭建推理管道,还将拓展视频生成功能。

新智元
开源动态7

一步步实战 CopilotKit(AG-UI协议):快速集成前端UI与后端Agent的神器【上】

文章介绍AG - UI协议及CopilotKit,前者为前端UI与后端Agent集成标准,后者是其参考实现。结合实例展示CopilotKit能力,包括前后端State共享、调用前端“工具”等,还给出构建演示Demo的详细步骤。

AI大模型应用实践
产品应用8

抖音+Claude Code=?马斯克都要转发的产品!一句话,就能做一个中国风福尔摩斯游戏!

Loopit被称为‘AI编程版的抖音’,用户说句话就能做互动内容,如解谜游戏等。它让编程像拍视频一样成消费品,有创作和社区,结合抖音轻量与游戏互动感,粘性更高。

AI产品自由
开源动态8

开源黑科技!向量数据库,居然要被 MP4 给干掉了!

GitHub开源项目Memvid,能用MP4视频文件替代昂贵的向量数据库,检索达亚秒级。它把文本编码成视频,用配套JSON索引记录位置,结合sentence-transformers和FAISS实现语义搜索,存储和检索性能出色。

AGI Hunt
7

倒反天罡!Claude「反向」操控人类,公司估值冲2万亿跃居全球第二

2026年1月17日,一段‘AI指挥人类写代码’视频刷屏,Claude Code能力引发关注,模糊人机交互界限。18日《金融时报》称红杉资本将参与Anthropic新一轮融资,其估值冲向3500亿美元,或成2万亿级AI独角兽。

新智元
新闻资讯7

《AI大模型与异构算力融合技术白皮书》10月10日发布

算泥社区《AI大模型与异构算力融合技术白皮书》10月10日14:00线上发布。AI大模型爆发使算力需求激增,异构算力成刚需。国内外政策与产业驱动其发展,该白皮书能为开发者提供实用技术参考

AIGC开放社区
算法论文8

苹果传统强项再发力,视觉领域三种模态终于统一

苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。

机器之心
算法论文8

ICCV2025 | One image is all you need,多模态指令数据合成,你只管给图,剩下的交给Oasis

近年来多模态指令数据合成依赖人工设计提示词,成本高。本文提出 Oasis 方法,仅靠图像生成数据,打破传统输入模式,还开源代码库 MM - INF。实验显示其数据多样,能提升 MLLM 性能。

机器之心
开源动态8

NVIDIA 开源 Live VLM WebUI:摄像头实时测试视觉语言模型

NVIDIA 开源 Live VLM WebUI,可让用户在本地用摄像头实时测试视觉语言模型。它基于 WebRTC 技术,能将摄像头视频流实时传输给模型,分析结果叠加在画面上,支持多后端、多平台及多种模型。

AI工程化