音视频智能」共找到 4253 篇相关文章

产品应用8

实测可灵3.0 - 属于每个人的导演时代。

可灵更新至3.0版本,将视频模型能力提升到新高度。它有分镜和语言两大升级方向,还升级了Omni模型。可灵3.0适合文生视频等,3.0 Omni擅改视频,二者结合能覆盖多数视频生成场景。

数字生命卡兹克
新闻资讯8

干货满载!腾讯云AI技术周圆满收官,回顾如何利用AI增效创收

2025腾讯全球数字生态大会启幕前夕,腾讯云联合InfoQ打造「AI技术周」,9月8 - 14日直播输出,围绕多关键议题邀大咖对话,公布多项AI+产品进展,涵盖降成本搭应用、AI Agent落地、数据库智能进化等内容。

InfoQ
新闻资讯7

山姆•奥特曼刚发长文:《丰盛的智能》,智能将人人可及

Sam Altman 发布新博文《Abundant Intelligence》,展现 OpenAI 的 AI 基础设施愿景。他认为获取 AI 将成经济驱动力甚至基本人权,还提出每周产一吉瓦 AI 基础设施工厂的计划,称增加算力是增收关键。

AGI Hunt
产品应用8

AI coding 智能体设计

文章从分析Gemini - CLI源代码入手,解读AI coding工具智能体设计。涵盖用户提示词预处理、工具注册与调用、架构设计、预置提示词等内容,还对比了Gemini - CLI和Claude Code可扩展性设计,介绍规约驱动开发模式。

阿里云开发者
推荐文章7

智能体时代的人月神话

作者 Wes McKinney 因 AI 打乱睡眠作息,在工程师圈子热烈讨论人类技术优势。他开发 RoboRev 工具,结合《人月神话》探讨软件工程未来,指出智能体虽提升生产力,但面临本质复杂性、范围蔓延等问题,设计与品味仍至关重要。

InfoQ
开源动态8

750城市+5000小时第一人称视频,上海AI Lab开源面向世界探索高质量视频数据集

上海人工智能实验室等机构联合推出持续迭代的高质量视频数据集项目Sekai,含Sekai-Real和Sekai-Game两个数据集,还训练了模型Yume。它特点突出,团队按四环节构建,望成世界建模等领域的数据基石。

量子位
算法论文8

OmniInsert:全新无掩码视频插入技术

基于扩散模型的视频插入技术发展快,但以往方法有局限。字节提出InsertPipe和OmniInsert,解决数据不足等难题。OmniInsert设计巧妙,还建立评测平台InsertBench,虽有小问题,但推理快,可加速优化。

带你学AI
开源动态7

解放双手!开源 AI 桌面智能

桌面智能体Bytebot是拥有专属计算机的人工智能,有完整虚拟桌面。它能使用任意应用、处理文档等。赋予AI独立计算机可解锁新能力,项目地址为https://github.com/bytebot-ai/bytebot。

GitHubStore
算法论文8

VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应

多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。

机器之心
产品应用7

字节推出全新视频换装框架DreamVVT

视频虚拟试穿技术受关注,但现有方法有局限。字节推出DreamVVT框架,基于扩散变换器,分两阶段试穿,能应对多种复杂场景,不过也存在依赖遮罩、复杂动作表现不稳定等问题。

带你学AI