多模态视频生成」共找到 3295 篇相关文章

产品应用8

昨天夸国产大模型争气,今天Vidu Q3就霸榜了

国产视频大模型Vidu Q3在国际权威AI基准测试机构Artificial Analysis的最新榜单里,于Video Arena冲到全球第二、国产第一。它是全球首个支持16秒音视频直出模型,声画同出、高清直出,还有镜头控制、多语言文字渲染等优势。

MacTalk
算法论文8

所有大模型,都学物理学:北大物理系一篇研究,震撼了AI圈

北大等机构团队跨界用物理学最小作用量原理,提出新颖方法估计 LLM 生成方向性,揭示其背后‘物理定律’。发现 LLM 生成有细致平衡现象,还能用物理指标给大模型画像,让 AI 研究提升到‘物理科学’高度。

机器之心
算法论文8

比Sora更疯狂!英伟达AI让机器人「做梦」修炼,无师自通直接上岗

英伟达新研究项目DreamGen用视频生成模型让机器人在神经网络生成的「梦境世界」自主探索学习。它能让机器人掌握新动作、泛化到新环境,合成数据暴涨333倍,还引入DreamGen Bench用于视频生成基准。

新智元
新闻资讯7

马斯克宣布:Grok学会看片了!无字幕看懂陶哲轩菲奖级难题

马斯克宣布Grok可分析任何视频。它能对伪造视频鉴假溯源,但也有处理画面靠字幕、有幻觉问题和效果不稳定的缺陷。实测中它能理解无字幕视频,还整理访谈内容。这功能虽便利,但引发人类能力退化担忧。

新智元
产品应用8

Harness Engineering: C 端 AIGC 内容生产自优化实践

文章介绍蚂蚁保保险快查深度解读页面生成系统(DIPG),它将Harness思想用于C端AIGC生产链路。DIPG采用‘离线生成+校验+刷入DB’模式,解决LLM实时生成时延和质量问题,还阐述多Agent协作、校验机制及回灌流程等。

阿里云开发者
新闻资讯7

确认!DeepSeek多模态AI已经开测

DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。

量子位
新闻资讯7

Gartner:生成式AI不会取代软件工程师

全球著名咨询调查机构Gartner官网发布专访,分析师Haritha Khandabattu认为生成式AI不会取代软件工程师,其可提高生产力。还谈及在招聘人才方面的变化及领导者助团队成功的关键措施。

AIGC开放社区
开源动态8

视频存储文本的黑科技!

memvid-rs是memvid的Rust重实现,可将文本文档编码为视频二维码实现存储和检索。它有高性能、用TRUE机器学习等特点,兼容多格式、跨平台,无需安装,适合存档文本语料库等。

GitHubStore
开源动态8

多模态Qwen3-VL-Embedding开源&技术剖析

互联网内容多元,传统文本搜索引擎应对跨模态需求力不从心。阿里开源Qwen3-VL系列两大模型,Qwen3-VL-Embedding负责“海选”,Qwen3-VL-Reranker负责“决赛”,技术亮点多,实验表现优异。

PaperAgent
新闻资讯7

糟糕,大佬45年前论文,被判AI生成

随着AIGC增多,AI内容检测需求迫切,但表现远不及预期。如作家Adam Kay、教授Devi Sridhar等多人的作品被误判,原因或是AI用人类内容训练,使判断边界模糊。

机器之心