「多模态视频生成大模型」共找到 3291 篇相关文章
【综述】MRAG5项关键技术(一):解析、索引
文章围绕多模态检索增强生成(MRAG)的关键技术展开。介绍多模态文档的三种类型,阐述文档解析与索引的方法,包括基于提取和基于表示的方法,还指出基于提取方法存在的局限性。
字节悄咪咪上线了 AI 版抖音「随变」,在下什么棋?
临近春节,字节跳动 1 月初上线的「随变」App 在年轻人中流行。它类似「纯净版」AI 抖音,核心功能有 AI 形象生成等。字节借此在小体量社区验证功能,解决抖音年轻用户留存问题,也想抢占 AI 视频市场。
文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”
港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。
空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没
上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。
CVPR2026 | Streamo:让大模型变成实时流式交互助手
香港浸会大学联合腾讯优图实验室提出 Streamo,将‘何时回答’变为模型预测的 token,通过端到端训练框架把离线视频模型转化为实时流视频助手,还构建 Streamo - Instruct - 465K 数据集,实验效果良好。
GLM4.5实测:审美不如R1,全栈还不大可用,别急冲
7月29日智谱开源GLM - 4.5。作者实测发现其在UI设计审美不如R1,生成卡片表现不一,Coding能力勉强及格,全栈代码生成未达可用阈值,存在无多模态能力、上下文窗口短等问题,目前还别急着冲。
实测对比!扣子空间播客功能完爆 NotebookLM,覆盖场景更大
多模态是大模型热门应用概念,文本生成语音赛道受资本青睐。作者实测对比扣子空间和NotebookLM,发现扣子空间播客功能更优,能精准拿捏尺度,覆盖场景大,还能做旅行攻略、生成网站等。
大的来了:谷歌Gemini 3.0 Pro单次生成网页版操作系统,Win、Mac、Linux一网打尽
海外平台爆火的视频展示了用未发布的谷歌Gemini 3.0,仅靠几行提示词在2分钟内One Shot生成网页版操作系统。与Claude 4.5 Sonnet对比,Gemini 3.0优势明显,还展现出高超前端设计能力,但离真正构建操作系统仍有距离。
GPT-Image-2平替!最强开源生图模型来了
OpenAI推出GPT Image 2引发AI生图大战,国内厂商商汤反击,推出多模态理解生成模型SenseNova U1并全面开源。它通过自研架构实现理解、推理、生成统一,实测表现惊艳,能力全维度,与GPT-Image-2范式不同。
全球AI双榜第一!力压谷歌Veo与Grok,Vidu Q3「参考生」之王归来
这个月初谷歌免费开放Veo 3.1视频生成能力,让AI视频更普及,但模型距‘能交付’仍有差距。Vidu Q3带着‘全家桶’回归,覆盖多领域,在权威评测榜单成绩优异,视觉、听觉和场景能力升级。