「视频大语言模型」共找到 8227 篇相关文章
LeCun预言成真!790年长视频,炼出最强开源「世界模型」
2025年‘世界模型’成AI巨头战场,谷歌、李飞飞团队等纷纷布局。上周北京智源研究院发布Emu3.5,340亿参数,基于790年长视频数据训练,其架构优越,推理快,能力强,还公开技术报告邀全球探索。
图灵奖得主LeCun最后警告Meta!我搞了40年AI,大模型是死路
图灵奖得主Yann LeCun预计将很快离开Meta。因Meta风向转变,LeCun失势。他投身AI研究40年,认为大语言模型是死路,世界模型才是未来,或为此离开Meta并计划创业。
翻译界的ChatGPT时刻!Meta发布新模型,几段示例学会冷门新语言
Meta人工智能研究团队发布Omnilingual ASR系统,能识别1600多种语言,可通过少量示例快速学会新语言。它以开源与社区共创为核心,打破语言技术不平等,让更多语言登上AI舞台。
LiveWorld:视频世界模型新范式,让镜头之外的世界继续演化
现有视频世界模型存在“静态世界假设”,物体离开视野后状态不再更新。阿德莱德大学等研究者提出 LiveWorld,将世界演化与观察渲染解耦,使事件在视野外持续推进,并通过实验验证其有效性。
跳出「黑盒」,人大刘勇团队最新大语言模型理论与机理综述
大语言模型工程成功但理论研究滞后,被视为「黑盒」。人大刘勇团队用生命周期分类法,将LLM理论研究整合为六阶段,系统综述底层理论与机制,指出前沿挑战,为其向严谨科学转型提供路线图。
14B规模竟也能单卡实时生成视频?多亏这个强大的开源底座
春节期间 Seedance 2.0 爆火,字节跳动等开源视频模型 Helios 家族,参数量 14B,单卡生成速度达 19.5 FPS。它与 UniWorld-OSP2.0 技术栈同源,后者是超百亿级视频生成大模型,有诸多技术突破。
当顶级视频模型半衰期只有 30 天,fal.ai 为什么收入反而一年增长 60 倍?
在生成式媒体技术发展背景下,fal.ai 作为生成式媒体 infra 公司迅速崛起。它通过统一 API 与云端平台提供多模态模型调用能力,2025 年收入增长 60 倍并完成融资。文章解析其如何构建护城河及对行业发展的判断。
港大联合字节跳动提出JoVA: 一种基于联合自注意力的视频-音频联合生成模型
香港大学联合字节跳动提出视频 - 音频联合生成框架 JoVA,支持音视频 Token 跨模态交互,引入嘴部区域特定损失解决口型同步问题。实验显示,它用约 190 万条数据就达先进水平。
性能最高提升7倍?探究大语言模型推理之缓存优化
文章探讨大语言模型推理缓存优化技术演进与未来展望,介绍了主流推理框架vLLM、SGLang,分析KV Cache、Paged Attention、Prefix Caching等技术的优化点,还提及LMCache、DeepSeek的缓存技术,最后提到MCP赋能可视化OLAP智能体应用。
Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI 发布 2.4B 参数量的视觉语言模型 Jina-VLM,在多语言视觉问答任务达 SOTA。它引入注意力池化,连接视觉与语言基座,支持 29 种语言,能高效处理问答等任务,对硬件需求低。