「多模态视频生成大模型」共找到 3295 篇相关文章
DeepSeek睁开眼了!Opus-4.8的性能,1000张图不到20美分
DeepSeek首个多模态视觉模型deepseek-v4-flash-vision-exp上线DeepSeek API平台。文本能力与V4-Flash持平,多模态Agent能力逼近Opus-4.8,分析1000张图成本不到20美分,还上线免费Files API。
@所有开发者:Agent变现,阿里云百炼联合支付宝首创「AI打赏」!Agent Store全新发布
2025年是Agent元年,不过很多项目卡在POC阶段。6月25日阿里云百炼3.0全新升级,联合支付宝推“Agent打赏”功能,还上线Agent Store。此外,它升级多模态RAG和MCP能力,推出多模态交互开发套件。
5秒出4张2K大图!阿里提出2步生成方案,拉爆AI生图进度条
阿里智能引擎团队针对Qwen最新开源模型,将SOTA压缩水平从80 - 100步前向计算骤降至2步,速度提升40倍,5秒可出4张2K高清大图。已发布Checkpoint,集成到呜哩AI平台。文章还分析传统蒸馏方案问题并介绍团队改进策略。
全球首个人形机器人通用视觉感知系统,Humanoid Occupancy建立多模态环境理解新范式
北京人形机器人创新中心推出 Humanoid Occupancy 感知系统,创新性融合多模态传感器信息,构建通用感知框架。它以语义占用表征为核心,有全编码和适配融合优势,经实验验证性能优,推动机器人迈向通用感知时代。
北大卢宗青:现阶段世界模型和 VLA 都不触及本质|具身先锋十人谈
北大卢宗青作为具身大脑创业者,认为现阶段世界模型和 VLA 未触及本质。他指出互联网视频数据是唯一可规模化的道路,其创立的「智在无界」正标注互联网视频中人类关节动作让模型学习。
一个月暴涨3K star,这是我见过最好用的AI生成PPT项目了!
职场人做PPT常耗在调格式等方面,现有AI工具多有缺陷。`dashi-ppt-skill`项目可生成网页版PPT编辑器,有多种主题、版式和控件,功能丰富,能本地完成操作,还介绍了安装和使用方法。
刚刚,小红书开源了首个多模态大模型dots.vlm1,性能直追SOTA!
小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。
细节直逼亚毫米级!港科广分层建模突破3D人体生成|CVPR 2025
港科广团队提出MultiGO创新方案,借助分层建模思路突破3D人体生成难题。该方案通过三级几何学习框架提升重建质量,在多个测试集上性能领先,且在多领域有应用优势,研究成果入选CVPR 2025,项目代码将开源。
ACL 2026 Main | 不只是调用地图API,Spatial-Agent让大模型生成可执行地理分析工作流
大语言模型在空间领域应用广泛,复杂地理分析问题需组织自然语言成可执行流程。Spatial - Agent 加入 GeoFlow Graph 中间层,借用 GIScience 理论,实验显示能提升准确率,不过仍受数据质量等限制。
Codex 跟练全攻略
本文聚焦 Codex 学习,指出知名 AI 视频博主更新慢,而 B 站有全面的「Codex 跟练」专题,含快速安装、基础入门、进阶技巧、场景应用四个专区,不同阶段用户都能找到合适内容,视频跟练更高效。