「多模态内容」共找到 1707 篇相关文章
每周产业洞察 | AI影视文艺复兴已至,未来24个月内容供给将迎结构性变化
北京AIGC视听产业创新中心位于朝阳区,由多方参与、首创郎园负责运营,通过六大服务平台促进成果转化与场景落地。截至2025年8月已汇聚60余家生态伙伴,首创郎园拓展多地业务。
字节跳动Seed1.5-VL复杂图表精准抽取,Deep Think是多模态未来的主流
文章介绍字节跳动的Seed1.5-VL模型,它能精准抽取复杂图表,处理模糊图片、推理几何题。其由视觉编码器和LLM组成,预训练语料丰富,后训练结合多种方法,推荐在huggingface体验。
每周产业洞察 | AI音视频模型能力全面嵌入“专业级视听内容”交付,对齐“制作级”
北京AIGC视听产业创新中心位于朝阳区,是朝阳区推动影视制作基地建设举措。由多方参与,首创郎园运营,提供六大服务平台,截至2025年8月汇聚近百家合作伙伴。首创郎园拓展服务能力,项目多地开花。
AI生成内容如何确权?全国首部区块链知识产权存证标准启动编制,欢迎参与起草!
区块链存证技术能解决知识产权确权、举证、维权难题,但实践中存证流程不规范等问题凸显。全国首部《基于区块链的知识产权存证管理规范》团体标准立项,正征集起草单位和起草人,可解决企业核心困境。
Agent 重构互联网,谁将受益于线上内容的“帕累托效应”?|AGIX PM Notes
文章围绕AI时代展开。在搜索领域,谷歌垄断案法庭主张其向竞争者开放搜索索引数据,这能助对手构建强大索引、补短板。商品服务层面也有80 - 20重构。还提及本周市场动态、AI企业相关消息,如谷歌案裁决、OpenAI成本预期等。
腾讯混元开源游戏AI生成新工具!RTX 4090就能制作3A级动态内容
腾讯开源游戏视频生成框架Hunyuan - GameCraft,基于混元视频生成搭建,操作简单,输入单张场景图、文字描述和动作指令就能生成高清动态游戏视频,解决传统工具瓶颈,性能优于主流模型。
ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字与图像在统一架构中共同演化
NUS、ZJU 等联合提出「ThinkMorph」,主张文字与图像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。
多模态推理新范式:上海AI Lab新作证明“画”出答案比“说”出答案更靠谱
上海人工智能实验室等联合提出DiffThinker模型,利用扩散模型构建全新视觉推理范式。它在视觉中心任务上表现优异,准确率碾压GPT - 5等模型,还能与MLLM协同推理实现1 + 1 > 2的效果。
AI Agent如何重构企业核心系统?深度拆解Agent、多模态与组织变革的实战路径|AICon
12月19 - 20日北京举办的AICon大会,围绕AI Agent等展开探索。来自腾讯等企业的人士将分享构建智能系统经验。大会有Keynote、平行技术专场、晚场辩论等,涵盖多领域议题,为参会者带来前瞻思想盛宴。
Meta 系 95 后华人明星团队,创业一年就与高通达成合作,让手机拥有多模态记忆
由华人创业者沈俊潇创办的 Memories.ai 发布 LVMM 2.0 并宣布与高通合作,该模型 2026 年将在高通处理器上原生运行。它解决视频可搜索性问题,应用广泛,能降低延迟、确保数据安全等。