算法论文8
腾讯混元:MTSS 解决视频处理难题
机器之心
AI 摘要
腾讯混元团队:提出 MTSS 范式,升级视频描述方式。它解决传统‘流水账’描述的问题,通过实验验证在视频理解和生成上效果显著,为视频大模型指明新数据工程道路。
阅读原文 · 机器之心
AI「看不懂」、「做不好」视频的问题,混元用「MTSS」解决了
腾讯混元团队提出 Multi-Stream Scene Script(MTSS)新视频描述范式,将传统方式升级为‘多流结构化剧本’。它解决了传统方式语义冗余、扩展性差等问题,在视频理解和生成任务表现显著。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
PhiZero:让AI学会「物理语言」
PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。
机器之心
开源动态8
Alaya - EVOKE开源,可生成小时级视频
Alaya Lab等联合推出的Alaya - EVOKE能生成小时级视频,解决常见问题。它把记忆搬到模型外,改造教师模型,经多轮技术操作,实验成绩佳,给出清晰训练方案,也指出项目边界。
量子位
产品应用7
智象未来发布交互式世界模型HiDream - O1 - World
8月17日,智象未来发布交互式世界模型HiDream - O1 - World,定位为全球首款原生全模态交互式世界模型。它提供漫游和编辑两种交互方式,在WBench测试中成绩优异,但开放场景表现待验证。其采用独特生成方式,有广阔应用前景。
DeepTech深科技
算法论文8
RefCaptioner 让视频与参考图精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
机器之心