统一多模态生成编辑模型」共找到 3193 篇相关文章

开源动态7

用开源中转统一接入Claude/OpenAI/Gemini:Sub2API核心功能解析

若同时用Claude、OpenAI、Gemini等,会面临账号分散、API Key管理难等问题。Sub2API是开源一站式中转服务,能统一接入这些订阅,还具备多账号管理、精确计费等功能,有多种部署方式。

小华同学ai
产品应用8

超震撼发布!全球首款实时生成游戏引擎Mirage来了

Mirage是全球首个实时生成引擎,借助先进AI世界模型实现实时UGC玩法,支持多种游戏类型。与其他成果相比优势显著,由定制模型驱动,打破传统游戏边界,让玩家动态创造新体验。

带你学AI
推荐文章8

解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南

多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。

AIGC开放社区
开源动态8

LTX-2开源:首个能同时生成视频和音频的模型

LTX-2开源,它是Lightricks团队开发的首个开源多模态基础模型,能联合生成音频和视频。采用非对称双流扩散变换器架构,用深度多语言文本编码器,速度比许多纯视频开源模型快,让模型理解声画关联。

AI工程化
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。

PaperAgent
开源动态8

阿里开源 Wan2.2-Animate!统一角色动画和视频人物替换

阿里通义实验室开源 Wan - Animate,这是用于角色动画与替换的统一框架。它构建于 Wan 模型之上,支持角色动画和角色替换两项核心功能,性能超现有算法,还通过独特设计实现多种效果。

带你学AI
新闻资讯8

李飞飞发布世界模型新成果:一个提示,生成无限3D世界

李飞飞创业团队World Labs宣布能生成持久、可导航且能自定义操控的3D世界。该模型专注构建3D环境,有更好几何形状、多样风格、更大规模,还支持无限畅游,已推出beta版。

量子位
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取,复杂图文推理任务中多模态大模型深度推理能力缺乏评估标准。OCR - Reasoning可系统性评估,还列举多种推理示例,并测评了Qwen2.5 - VL - 7B模型。

CourseAI
算法论文8

CL-Bench的故事没有结束,生成式CL-Bench:GENIUS来了

北大团队发布GENIUS,用于评估模型生成式流体智力。它构建含510个样本、20个子任务的评测集,测试模型多方面能力。实验显示当前模型流体智力有短板,还提出免训练注意力校准机制提升性能。

机器之心
算法论文8

MIT & Google | 提出异步并行生成新范式,LLM推理效率大幅提升!

MIT与谷歌团队在研究PASTA中探索异步生成范式,开发标记语言PASTA - LANG,采用双阶段训练流程,设计推理系统。实验显示PASTA平衡性能与质量,有可扩展性,为LLM推理效率优化开创学习驱动新路径。

AINLPer