图像到视频」共找到 3220 篇相关文章

产品应用8

一手实测全新的Sora 2 - AI视频的ChatGPT时刻来了。

OpenAI发布Sora 2和Sora APP,Sora 2是视频和音频生成模型,在运动质量、人物表演、音频生成等方面表现出色;Sora APP类似AI版抖音,有社交互动“cameos”功能,但产品未来尚不明朗。

数字生命卡兹克
产品应用7

用Spring AI Alibaba把MultiAgent实现从5天压5小时

Spring AI和Spring AI Alibaba新版本支持Multi - agent编排。文章展示基于Spring AI Alibaba实现Multi - agent,从原理实战,给出示例代码,解决手写框架问题,对比两种编排方式优劣,强调选对框架可提升开发效率。

阿里云开发者
推荐文章7

《动手写AI Agent》会话与记忆:记住上次聊哪了

文章围绕《动手写AI Agent》的会话与记忆展开,指出LLM无状态、无会话持久化会让对话记录丢失。介绍了解决方案,如把对话存磁盘及构建长期记忆,阐述设计决策并提文件系统存储方案。

AI Reading Hub
新闻资讯8

从Token词元:全模态时代的基模与交互入口

2026年3月24日国家数据局确立“词元”为Token标准译名,Token生成与消耗方式在多模态场景正发生变化。模思智能获数亿融资,探索从语音全模态的路径,成果颇丰且完成能力闭环,其发展受关注。

量子位
开源动态8

面壁小钢炮 VoxCPM-TTS:开源端端 TTS,轻量高效低延迟

面壁提出基于扩散自回归建模的端端语音生成模型 VoxCPM,构建于 MiniCPM - 4 之上。它克服传统离散 token 方法缺陷,实现语义与声学特征解耦,有上下文感知语音生成和零样本语音克隆能力,低延迟。

带你学AI
新闻资讯8

沈亦晨的九年:从MIT一间实验室港交所大堂

2026年4月28日,曦智科技在港交所敲钟,股价表现亮眼。创始人沈亦晨从MIT实验室起步,带领公司历经九年发展,在光计算和光互连领域取得诸多成果,虽亏损但受市场热捧,光计算产业也吸引大厂入局。

DeepTech深科技
开源动态8

从全局部件:腾讯全新开源Hunyuan3D-Part和Omni

腾讯全新开源Hunyuan3D - Part和Omni。Hunyuan3D - Omni支持多模态输入,统一信号跨模态架构提升融合鲁棒性。Hunyuan3D - Part含P3 - SAM和X - Part,分别用于部件分割与生成,在对应领域达先进水平。

带你学AI
推荐文章7

任务自适应 Harness:从 Trace 多 Coding Agent 的协作记忆

作者为AI Coding准备的端端方案未落地,后在Routa项目找新落点。基于ACP协议的Agent Trace可记录关键行为,用于分析优化。还介绍了Feature Explorer、Kanban Harness及任务自适应Harness,探讨多Agent协作记忆。

phodal
新闻资讯7

AI 驱动的智能异常处置:从异常发现根因定位

在 2025 年 QCon 全球软件开发大会(北京站)上,阿里云算法专家张颖莹分享《AI 驱动的智能异常处置:从异常发现根因定位》。她介绍阿里云计算平台运维挑战,给出算法选型与设计思路,还提及后续平台建设规划。

InfoQ
产品应用8

构建会思考的测试Agent:从自动化自主智能的演进

文章介绍面向企业级软件测试的质量数字人系统,结合大语言模型等实现从传统自主智能测试跨越。分析专有云测试困境,指出通用AI Agent平台局限,阐述系统设计、能力及架构,展示应用成果并展望扩展场景与未来计划。

阿里云开发者