「多主体视频生成」共找到 2692 篇相关文章
从0到1拆解FreeWheel ChatBI:大模型如何重塑视频广告智能数据分析新生态
本文结合 FreeWheel 实际应用经验,分享构建 ChatBI 系统核心实践。介绍其核心功能、技术实践,如让 LLM 理解业务、智能选表等,还提及系统架构、算法服务,最后总结上线效果并展望未来优化方向。
硅基流动完成新一轮数亿元融资,打造开发者首选生成式 AI 开发平台
硅基流动完成数亿元 A 轮融资,由阿里云领投。创始人袁进辉称业务因开源大模型崛起和算力需求激增爆发式增长。公司推出高性能推理引擎等,产品服务多个行业,未来将深耕创新、推动 AI 应用。
开源播客生成MoonCast:让AI播客告别"机械味",中英双语对话更自然!
MoonCast是革新性对话式语音合成模型,已开源。它借助LLM让剧本有干货与人味,采用全面规模化策略使音频合成更自然,性能在双语长对话播客上提升显著,接近真人播音效果。
新DeepSeek R1代码能力直逼Claude 4!附生成任何优质网站的通用提示词
作者体验DeepSeek R1超8小时,发现其文本写作问题大幅修复,思维链推理改进,代码能力提升,前端审美直逼Claude 4。文章展示其前端能力,给出写前端网页提示词及设计逻辑,还探讨了其在复杂任务中的表现。
AI无限生成《我的世界》,玩家动动键盘鼠标自主控制!国产交互式世界模型来了
昆仑万维带来交互式世界模型Matrix - Game,可让用户用键鼠探索创作虚拟内容。它发布了Matrix - Game - MC数据集、主模型和GameWorld Score评测体系,在多项评测中领先,还能在多领域发挥作用。
3.8K Star!港大开源 AI 量化神器:一句话生成量化策略,普通人也能玩懂!
港大开源的Vibe - Trading在投资圈火了,它是AI驱动的多智能体金融工作台,能将自然语言请求转化为交易策略等。有多智能体协作架构,内置64个金融技能、29个智能体团队预设,提供4种安装使用方式。
谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...
谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。
用2D先验自动生成3D标注,自动驾驶、具身智能有福了丨IDEA团队开源
IDEA团队张磊团队提出OVSeg3R开集3D实例分割学习新范式。它无需人工后处理和3D掩码标注,降低训练成本,有望让3D实例分割商业落地,可用于自动驾驶、智能家居等领域。
5.8K Star爆火!!在终端里开网页、刷视频、玩游戏,这操作真绝了!
介绍开源工具`term.everything`,它能在终端运行任何GUI应用,像浏览器、游戏等。该项目在GitHub获5.8K star,支持X11和Wayland应用,可远程使用,但画质和性能有局限。
创新中心 | AI短剧剧本创作课程回顾:以 AI 为翼,解锁短剧创作工业化生成之路
9月12日,智创山海创始人洪浩洋在OurTimesHere主讲《AI短剧剧本创作实战与避坑》课程,从短剧核心属性、爆款创作要点、工具应用到行业趋势,给出AI短剧创作方案,还演示自研平台“甜椒SweetPepper”。