视频幽默理解」共找到 1648 篇相关文章

产品应用7

国产游戏理解模型刷新SOTA,对话逗逗AI CEO:开源模型+行业数据是突破关键

2025年末国产开源模型影响力凸显,东京电玩展上逗逗AI的游戏理解模型LynkSoul VLM v1超顶尖闭源模型。其CEO刘斌新表示,开源模型结合行业数据是突破关键,还探讨了产品技术、交互及发展趋势等。

量子位
产品应用8

小白也能玩转AI视频!即梦Agent模式实测:一句话搞定插画、海报、Vlog

即梦AI新上线Agent模式,用户只需一次输入指令,就能从生图到生视频全搞定。该模式还具备AI小助手功能,能满足多种需求。它基于Seedream 4.0模型,将AI生图降至0门槛,官网现推出免费生图活动。

量子位
算法论文8

图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果

百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。

量子位
算法论文8

AAAI 2026|视频大语言模型到底可不可信?23款主流模型全面测评来了

合肥工业大学与清华大学团队推出视频大语言模型综合可信度评测基准 Trust-videoLLMs,对 23 款模型从五维度 30 项任务评测,揭示性能格局,指出模型现存问题,还开源评测框架等。

机器之心
产品应用8

AI智能体加持,爆款视频产出速度提升了10倍,全民导演时代已来

Video Ocean在影像创作领域带来革新,通过AI Agent实现一人完成多职能,将拍摄周期大幅缩短。它打造自动化创作生态,能快速批量生成爆款视频,覆盖多种创作场景,操作简单,打破创作壁垒。

机器之心
产品应用8

从 “可用” 迈向 “好用”:详解火山引擎智能视频云的三层架构升级|甲子光年

2025年AI关键在多媒体领域,智能多媒体落地有变革也面临挑战。火山引擎提出智能视频云三层架构升级,即基建、平台、应用层升级,助企业实现低成本、高效率规模化应用,多行业已基于此打造能力。

甲子光年
产品应用7

AI陪伴Top 1应用上线视频生成!图片人物能说话唱歌,多轮对话场景依然稳定

AI陪伴应用Top 1的Character.ai(c.ai)上线视频生成功能AvatarFX,可让静态图片人物“开口说话”。c.ai还上新多项AI创作功能。此外,谷歌收购c.ai遭美国反垄断调查。

量子位
算法论文8

NUS、牛津等联合发布音视频智能综述:系统梳理大模型时代的AVI全景图

NUS领衔近10家机构发布音视频智能综述,系统梳理大模型时代AVI发展全貌,涵盖感知、生成与交互,复盘子方向工作,构建任务蓝图,整理评测体系,总结基础技术,还探讨应用、安全及未来研究方向。

新智元
推荐文章8

Agent 一年半开发复盘:大家对 Agent 的理解有错位,有效的「认知流程」很关键

本文是作者对一年半AI开发过程的复盘,指出大家对Agent理解有错位,强调有效「认知流程」的关键作用。通过高考、学霸成长等例子阐述Agent核心,对比Chatbot与Agent,还从理论视角解释其有效性,最后点明开发者角色转变及面临的挑战与前沿探索方向。

Founder Park
开源动态8

41个榜单SOTA!智谱最新开源GLM-4.5V实测:看图猜地址、视频秒变代码

智谱基于GLM - 4.5打造的开源多模态视觉推理模型GLM - 4.5V,在42个公开榜单中41项夺得SOTA。其功能丰富,玩法升级,还为企业与开发者提供高性价比方案,是100B参数级SOTA标杆。

新智元