「图像到视频」共找到 3220 篇相关文章
对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型
InfoQ对话格灵深瞳灵感实验室,探讨多模态大模型下视频理解问题。指出传统视频模型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破长视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。
Seedance 2.0,凭什么刷屏?
2026年2月7日,字节跳动旗下AI视频生成大模型Seedance 2.0开启内测后刷屏。它解决AI视频可用率低、成本高的痛点,引发资本市场关注,虽面临挑战,但也让AI视频成可用生产力工具。
大模型如何准确读懂图表?微软亚研院教它“看、动手、推理”
多模态大模型处理结构化图像有误差放大、推理难等问题。微软亚洲研究院等提出PixelCraft,以高保真图像处理与非线性多智能体推理为支柱,提升结构化图像理解性能,在多基准上有增益。
刚刚,谷歌放出Nano Banana六大正宗Prompt玩法,手残党速来
谷歌 Nano Banana 被网友玩出花样,背后是巧妙提示词的功劳。刚刚谷歌官方公布了该模型六个文本转图像提示,可进行文本生成图像等操作,还给出对应提示模板,不过使用中也存在一些问题。
更少的token生成更好的图!香港大学联合阶跃星辰等让AI绘画真正理解了再画
香港大学、阶跃星辰等用VFMTok新方法,让图像生成模型借用顶级视觉AI的眼睛看世界,实现更快、高质量图像生成,且无需复杂引导技巧。它改变图像理解方式,将像素死记硬背转为语义理解。
第一股AI亚文化兴起了
今年兴起由文生视频技术推动的AI亚文化,如AI生成的职场视频,主角是Sam Altman对历史名人进行PUA,国内外这类视频数据都很好。亚文化兴起特征是解构权威,且技术成熟促使其诞生。
快手可灵也吃上了香蕉,一通离谱prompt测试,好好玩要爆了
ChatGPT发布三周年,快手可灵AI视频「O1模型」登场,号称“全球首个统一多模态视频模型”。实测显示它能一站式搞定视频修改、镜头延展等操作,还推出了图片O1模型,在图片生成方面表现出色。
2026,最惨一年?Optimus全员拼到死,清华校友跳槽到特斯拉
苹果核心华人AI科学家Yilun Chen转投特斯拉Optimus团队。马斯克透露AI芯片进展,特斯拉AI软件副总裁预警2026年是艰难一年。同时,部分特斯拉核心工程师出走至初创公司,硅谷投资人看好家用消费级机器人。
Token纪元:从「马力」到「人天」再到「兆字元时」的认知革命
文章指出,AI时代需全新生产力计量单位“马斯”。字元是AI“语言燃料”,但缺乏统一计量体系。智能社会的容量、速度、价格是关键指标,当前AI算力网络停在2G时代,AI劳动力崛起将重构就业,Token或引发文明跃迁。
马斯克宣布:Grok学会看片了!无字幕看懂陶哲轩菲奖级难题
马斯克宣布Grok可分析任何视频。它能对伪造视频鉴假溯源,但也有处理画面靠字幕、有幻觉问题和效果不稳定的缺陷。实测中它能理解无字幕视频,还整理访谈内容。这功能虽便利,但引发人类能力退化担忧。