中文音视频一体化」共找到 1159 篇相关文章

产品应用8

Qwen3-LiveTranslate:视、听、说全模态同传大模型!

Qwen3-LiveTranslate-Flash 是基于大语言模型的多语言实时音视频同传模型,依托 Qwen3-Omni 能力与海量数据,有多语言和方言支持、视觉增强等亮点,性能超主流大模型。

通义千问Qwen
开源动态8

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

openJiuwen社区发布业界最早工程化落地的多模态Skill范式Skill-Omni,让Agent经验从‘读得懂’升级为‘看得见’。它能将网页和视频视觉知识沉淀为多模态Skill,还介绍了生成及读取方式和适用任务。

量子位
产品应用7

全新唇同步技术OmniSync,遮挡,侧脸不在话下

唇同步对创建逼真视频内容很重要,但现有方法在身份一致、姿势变化等方面有局限。中国人大携手快手提出OmniSync,引入无需掩膜的训练范式,保证身份和姿态一致,能适应复杂场景,还建立AIGC - LipSync基准。

带你学AI
算法论文8

7B打败o3、GPT-5!医学AI智能体让模型学会“看哪里、怎么看”

上海创智学院LeapQuest团队联合多校,在ICML 2026接收两篇论文,提出“Think with Images/Think with Videos”范式,让视觉证据参与模型推理,Ophiuchus和MedScope分别用于图像和视频诊断,表现出色。

量子位
算法论文8

AI记忆系统首获统一框架!6大操作让大模型拥有人类记忆能力

香港中文大学等团队发布AI记忆机制综述,首次构建统一框架,划分记忆类型,提出六种操作,探讨关键主题,还对比人类与AI记忆,指明未来AI记忆系统需突破瓶颈,迈向认知跃迁。

量子位
产品应用8

我给 Claude Code 加装了 MiniMax M2.5:它像“法拉利”,但更像一台工作机

作者给 Claude Code 加装 MiniMax M2.5 模型,测试其编程、上下文记忆等能力。M2.5 在多方面表现出色,能高效完成各类开发任务,还具备良好的中文处理能力,性价比高。

MacTalk
新闻资讯8

内容娱乐新风向:这群创业者靠多模态 AI 玩出了新花样

12月23日,「MASHANG DEMO TO DAILY」第二期活动在杭州开启,展示多模态AI探索成果。6位创业者分享精华内容,涉及游戏开发、虚拟社区、视频创作等领域,探讨多模态AI产品价值与发展方向。

特工宇宙
新闻资讯7

中国机器人手机火爆MWC!老外快门按得根本停不下来

2026年MWC巴展上,荣耀推出的机器人手机Robot Phone引发关注。它有外接云台摄像头,能全角度AI视频通话、互动拍摄,还可结合旗下人形机器人联动。其结构压缩,AI能力强,打开了手机设计新思路。

量子位
算法论文8

告别噪声初始化:NTU MARS Lab提出A2A新范式,实现机器人高性能单步动作生成

新加坡南洋理工大学 MARS Lab 提出 Action-to-Action (A2A) Flow Matching 新范式,以历史机器人轨迹为生成起点,打破生成速度与精度瓶颈,在训练效率、推理速度及泛化表现上佳,还可扩展至视频生成领域。

机器之心
开源动态7

2.8K Star!开源免费的离线OCR工具,识别准确率媲美大厂。

在文档数字化和自动化工作流中,离线OCR工具受青睐。GitHub上的TrWebOCR开源、离线,中文识别率高,媲美大厂。它亮点多,有快速上手指南和接口调用示例,适用场景广,但两年未更新。

开源星探