「多模态视频生成」共找到 3309 篇相关文章
世界模型混战,蚂蚁炸出开源牌
蚂蚁集团旗下蚂蚁灵波发布并开源通用世界模型 LingBot-World,全面开源代码和权重,不绑定硬件或平台。它在多维度有突破,虽有细节瑕疵,但单次生成近 10 分钟连贯视频或刷新纪录,还在 VBench 测试领先。
就在刚刚,ChatGPT发布了一个新功能Pulse
北京时间凌晨,山姆·奥特曼宣布 OpenAI 为 Pro 用户上线 ChatGPT Pulse 预览版,后续会扩展到 Plus 用户及所有人。Pulse 核心是主动推送个性化更新,能结合多信息生成内容,但需用户开放大量个人数据,隐私问题值得关注。
文库 GenFlow 2.0,如何把 AI Agent 卷成“专家级”?
百度启动文库与网盘AI重构工程,8月18日GenFlow2.0发布。它生成的报告格式专业,能让用户实时干预任务运行,HTML在线报告交付体验好。其靠100多个专家Agent工作,构建了清晰产品层次和分层策略。
一场对话,我们细扒了下文心大模型背后的技术
信通院大模型推理能力评估中,文心X1 Turbo获最高级“4+级”。百度AI Day上,副总裁吴甜解析文心4.5 Turbo和文心X1 Turbo,从多模态、深度思考等方面介绍技术,还展示其在多场景应用成果。
全自研仿真GPU求解器x虚实对标物理测量工厂,打造具身合成数据SuperApp,加速具身仿真生态丨光轮智能@MEET2026
在量子位MEET2026大会上,光轮智能杨海波指出具身智能核心是数据,仿真是解决数据问题的唯一方案。光轮智能自研“测量、生成、求解”基础设施,建立全栈仿真平台,还打造多个“爆品应用”,为具身智能发展提供支撑。
千问App敞开玩,做红楼梦人物图、旅行海报、绘画书法无敌,顶级AI生图模型加持
作者体验阿里发布的Qwen - Image - 2.0模型后分享千问App玩法。可生成趣味信息图,如表情包、旅游攻略图、美食攻略图等;能做复杂文字梗图;还能创作中华文化传播图,如红楼梦解读图、手办图等,该模型懂中文意境。
这家 AI Lab 宣布所有模型无限期免费后,我顺手做了个图片版番茄钟
全球排名前十的 AI Lab,Agnes 宣布旗下核心全模态模型 API 无限期免费开放,包括文本、图片、视频。还新增百万 Token 上下文和 4K 图片生成功能。作者用其做了图片版番茄钟,官方也公开开发进度。
比英伟达早,比李飞飞强,大晓Kairos原生一体化世界模型定义物理AI新路线
大晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四大权威具身智能基准上全面登顶。
从Token到词元:全模态时代的基模与交互入口
2026年3月24日国家数据局确立“词元”为Token标准译名,Token生成与消耗方式在多模态场景正发生变化。模思智能获数亿融资,探索从语音到全模态的路径,成果颇丰且完成能力闭环,其发展受关注。
兵临OpenAI!谷歌集结2500人「复仇」,Gemini 3夺回AI王座
谷歌发布Gemini 3欲夺回AI主导权。谷歌DeepMind的CTO与AI Studio产品负责人剖析其发布盛况等,称这是与全球用户共建AGI的实验,还谈到模型发展、应用及多模态等问题,也承认仍有提升空间。