多模态方法」共找到 1354 篇相关文章

推荐文章7

读代码前先跑5个「Git命令」?火了,网友却吵起来了

文章介绍Ally Piechowski观点,读新代码库前可先运行五个Git命令,了解项目情况。不过网友对此有争议,认为Git数据不一定可靠,还可能过度解读。

机器之心
新闻资讯8

探秘琶洲模:不只是孵化器,更是“创新沙盒” | 甲子光年

在人工智能浪潮中,琶洲成为科技与商业策源地。2025年5月,琶洲模启动运营,它突破传统孵化器模式,打造“创新沙盒”,以“一中心四平台”体系对抗技术黑盒不确定性,助力企业成长。

甲子光年
新闻资讯7

理解与生成统一多模态模型:现状与未来 | 直播预约

从GPT - 4o到Gemini,AI实现跨模态联合理解与生成,核心是统一多模态基础模型。但开源社区构建强大统一模型面临挑战。南大等团队梳理超750篇论文分析技术路线,将有直播探讨现状与未来。

深度学习自然语言处理
开源动态8

图像、视频一模搞定!字节全能原生多模态本地可部署

字节开源原生多模态模型Lance,仅3B激活参数,40G显存就能跑,已登顶huggingface趋势榜。它能进行图像与视频的理解、生成、编辑等操作,在多个基准测试中表现优异,多项性能居首。

AIGC开放社区
推荐文章7

末日来临,会古编程的我成了救世主

文章介绍网络小说《AI 编程末日,只有我会古编程》,讲述 2038 年超级 AI 接管代码生产后自毁,全球瘫痪,前腾讯工程师凭手写代码拯救世界。还探讨作者身份,分析不同阶段程序员对 AI 的焦虑,指出小说预言正成现实。

特工宇宙
算法论文8

比传统强7倍:Anthropic物理隔离危险知识,重塑大模型安全训练范式

Anthropic团队提出选择性梯度掩码技术(SGTM),在训练阶段将危险知识物理隔离到特定参数并剔除,实现安全性与通用能力更好平衡,抗恢复性是传统7倍,还能处理未标记危险数据。

AIGC开放社区
算法论文7

复旦等推出「第一人称视听基准」,补齐多模态模型「听觉拼图」

多模态大模型在真实世界会“失聪”,现有第一人称视频问答/理解基准长期偏“视觉中心”。复旦等团队推出首个系统评测第一人称声音理解能力的基准EgoSound,能让模型听懂世界,评测显示当前模型与人类差距大。

量子位
新闻资讯8

千丁数科魏振华:企业AI落地“六步”|甲子引力

2025年12月3日,千丁数科COO兼首席科学家魏振华在甲子引力年终盛典上,结合龙湖数字化沉淀与实践,复盘企业AI落地。他提出“六步”,并展示六大场景数据,为传统行业智能化转型提供参考。

甲子光年
算法论文8

多模态大模型持续学习系列研究,综述+Benchmark++Codebase一网打尽!

近年来,生成式AI和多模态大模型进展显著,但在动态环境下实现持续学习是挑战。中科院自动化所联合香港院AI中心系统性研究,提出综述、、Benchmark和Codebase,为相关人员提供全面支持。

机器之心
开源动态8

视觉Token注入CLIP语义,走向多模态理解与生成新范式

腾讯ARC Lab等机构提出全新视觉分词器TokLIP,将低级视觉Token与高级CLIP语义结合,支持端到端自回归训练,可接入LLM框架,降低计算与数据门槛,在多模态任务中表现优异,代码已开源。

量子位