视频 - 音频联合生成」共找到 2051 篇相关文章

开源动态8

智源:ArXiv CLI重磅开源!2亿+开放论文,即将化身科研智能体的技能包

智源研究院联合高校与社区开发者研发的 DeepXiv 开源并免费开放。它是面向智能体的科技文献综合性工具集,提供数据接入、一站式能力集成、丰富接入形式等核心能力,还通过实战演示展示其在科研任务中的价值。

机器之心
开源动态8

5B参数+4060Ti,10秒出图,全流程开源可复现!补齐统一多模态生成编辑的开源版图,让高质量图像生成真正变得更轻量、更普及

近日,多机构联合发布统一多模态生成编辑模型DeepGen 1.0,仅5B参数,集成五大能力,4060ti 16G上10秒出图,多项指标超大4倍工业级模型。团队开源全流程代码与数据,可从零复现。

量子位
算法论文8

ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字与图像在统一架构中共同演化

NUS、ZJU 等联合提出「ThinkMorph」,主张文字与图像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。

机器之心
新闻资讯8

首个智能体商业信任协议来了!支付宝携手千问 App、淘宝闪购等发布 AI 商业协议 ACT

1 月 16 日,支付宝联合千问 App 等伙伴发布 ACT 协议,它是中国首个面向 Agent 商业需求的开放技术协议。该协议打造 AI 与服务平台‘通用语言’,解决授权、安全等问题,让操作更放心,还降低商家对接成本。

InfoQ
产品应用8

OpenAI:如何用 Codex 在 28 天内极速打造安卓版 Sora

OpenAI发布工程博客,揭秘用Codex不到一个月打造Sora安卓版应用的过程。这款应用上线首日冲至Google Play下载榜第一,24小时内用户生成超百万视频,开发过程耗约50亿tokens,崩溃率仅0.1%。

AGI Hunt
开源动态8

里程碑时刻!首个100B扩散语言模型来了,技术报告揭秘背后细节

蚂蚁集团与高校联合团队推出 LLaDA2.0 系列扩散语言模型,其中 LLaDA2.0 - flash 参数量达 100B。技术报告披露细节,其解决了 dLLM 做大做强难题,性能比肩 AR 模型,为扩散模型工业化带来转机。

机器之心
产品应用7

5张 H800 带来 20 FPS 高保真实时虚拟人生成

传统扩散模型做视频生成速度慢、画面不稳定,难用于实时虚拟人场景。阿里Live Avatar框架将算法和系统一起设计,用TPP并行推理策略和RSFM机制等,5张H800 GPU能实现20 FPS高保真实时虚拟人生成。

带你学AI
新闻资讯8

GPT-5.1发布当天,文心5.0杀回来了

2025百度世界大会发布文心5.0,这一2.4万亿参数的原生全模态模型,训练之初融合多模态数据,支持联合输入输出。同日OpenAI推出GPT - 5.1,文心5.0在多方面表现出色,如情绪安抚更贴心、多模态理解能力强等。

新智元
7

华为刚投的物理AI:首家国产世界模型公司

华为哈勃联合华控基金对极佳视界进行亿元级A1轮投资。该公司是国内首家“纯血”物理AI公司,产品覆盖全栈软硬件,应用于自动驾驶和具身智能。华为偏好世界模型技术,此次投资信号明显。

量子位
算法论文8

仅100种子题,合成数据质量超GPT-5,阿里、上交提出Socratic-Zero框架

阿里巴巴与上交大联合提出 Socratic-Zero 框架,仅从 100 个种子问题出发,通过三智能体协同进化生成高质量课程。该框架合成数据质量超 GPT - 5 等,Solver 性能提升显著,工程友好,开启零数据自进化新路径。

机器之心