图像到视频」共找到 3235 篇相关文章

新闻资讯7

跑分第一,实战拉胯!GPT Image 1.5被骂惨,奥特曼这波悬了

OpenAI推出新一代旗舰图像模型GPT Image 1.5,生图能力强,免费用户可上手,开发者能调用API。它在跑分榜单成绩优异,但网友实测发现是‘高分低能’,引发吐槽。此外,其API价格降20%,此次更新是回击谷歌。

新智元
开源动态8

一句话搞定后端?揭秘被 52.1k 开发者选择的 PocketBase:真能让你 0 运维快速上线产品吗?

PocketBase是“把后端打包成一个文件”的开源项目,既可以作为独立的轻量后端服务直接运行,也能作为Go库嵌入应用中。它能解决团队做MVP等遇的痛点,有诸多核心功能和技术优势。

小华同学ai
算法论文8

理解帮助生成?RecA自监督训练让统一多模态模型直升SOTA

统一多模态模型在视觉理解和生成能力上不平衡,常理解强但生成弱。本文提出重建对齐(RecA)自监督后训练方法,不改动架构,用未标注图像训练,在多模型实验中提升性能,部分达SOTA。

机器之心
8

估值200亿美元!可灵AI被曝剥离快手单独融资

The Information爆料,快手计划分拆旗下视频生成模型可灵AI,目标估值200亿美元并计划明年IPO。可灵已开始盈利,在海外表现出色。快手拆分是因估值重构、资源压力和人才等三层压力。

量子位
算法论文8

多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开

上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成多种剪枝方法,提升了模型性能。

量子位
产品应用8

一手实测深夜发布的世界首个设计Agent - Lovart。

博主实测深夜发布的世界首个设计 Agent - Lovart。虽内测版细节粗糙,但大框架已现。它先匹配设计风格,再创建执行计划,还支持二次编辑等,集成多工具可生成视频等,未来或重写设计工作流。

数字生命卡兹克
新闻资讯8

火了!刚刚,李飞飞2篇最新文章发布!

AI圈近期被李飞飞两篇重磅文章刷屏,一篇阐述空间智能愿景,指出当前AI缺乏空间智能,其创办的World Labs提出世界模型;另一篇论文揭示当前视频理解基准自欺欺人,还提出新基准VSI - SUPER及预测性感知新范式。

PaperAgent
算法论文8

告别「边画边说」:LatentMorph 开启视觉生成隐式潜空间推理新范式

现有的文生图模型缺乏动态思考与自我修正能力,香港科技大学团队提出LatentMorph框架,将隐式潜空间推理集成T2I生成过程中,实验显示其显著提升基座模型性能,削减推理延时与Token消耗,实现人机认知对齐。

机器之心
开源动态8

低调霸榜全球最难SQL榜单超两月,国产AI这次选择高调开源!

蚂蚁数科低调霸榜全球最权威SQL榜单超两月后高调开源Agentar - SQL系列。其核心思想是让AI赋能生产,在金融场景验证后能力外溢多领域,还采用按效果付费模式,展现强大竞争力。

量子位
新闻资讯8

Runway Gen-4.5刷屏发布,把重量、尘土和光影都做对了,网友:颠覆

Runway Gen-4.5突袭发布,获“视频生成AGI时刻”评价,在Artificial Analysis测试中拿下SOTA。它能精准执行复杂指令,物理还原与视觉精准度强,官方将逐步开放使用权限,还直言其存在因果推理等局限。

量子位