可控视觉生成模型」共找到 2801 篇相关文章

推荐文章7

【综述】MRAG5项关键技术(一):解析、索引

文章围绕多模态检索增强生成(MRAG)的关键技术展开。介绍多模态文档的三种类型,阐述文档解析与索引的方法,包括基于提取和基于表示的方法,还指出基于提取方法存在的局限性。

CourseAI
推荐文章7

周杰伦发的1400万人点赞的AI视频,是怎么做出来的?

周杰伦抖音首条1400多万点赞的AI视频,将其人生节点与专辑串联,有史诗叙事感。文章介绍用AI视频首尾帧功能制作视频的方法,还举例岳云鹏、《甄嬛传》、科比等,称AI能倒转时空。

数字生命卡兹克
新闻资讯7

AI 陪伴硬件的反共识讨论:主体性很重要,同质化竞争不存在

文章围绕AI陪伴硬件展开讨论,邀请创业者探讨产品角色定位、性别设定、用户反馈等问题。指出产品应注重主体性,避免破坏角色感,还提及应对同质化竞争、产品寿命、视觉研究等方面的思路。

Founder Park
新闻资讯8

百度搜索 10 年来最大改版,支持超千字长文本输入和 MCP 调用

7月2日,百度搜索宣布十年来最大改版,搜索框变“智能框”,支持超千字输入,集成AI写作等功能。“百看”功能、AI助手升级,接入视频生成模型MuseSteamer,还接入1.8万+MCP,提升搜索体验。

InfoQ
开源动态8

智源新出OmniGen2开源神器,一键解锁AI绘图「哆啦 A 梦」任意门

2024年9月智源研究院发布统一图像生成模型OmniGen,获社区好评。近期OmniGen升级为OmniGen2,增强多方面能力且全面开源。它采用新架构与策略,有反思机制,玩法丰富,还推出新基准优化部署。

机器之心
开源动态8

开源人工智能:数字主权的基石

随着人工智能重塑各领域,数字主权成现实需求。开源人工智能可检查、可解释,能助力各国治理、审核和建设AI系统,是实现自主可控、激发创新、重建信任的关键,为数字主权各维度提供支持。

Hugging Face
新闻资讯7

刚刚,1500名作家向 AI 宣战!

1500位作家联名向美国出版商发公开信,要求拒绝AI生成的书籍内容,称创作被AI“偷走”,还指出AI有声书取代人类、耗能大等问题。此前法院裁定用受版权书籍训练AI属合理使用。

AGI Hunt
开源动态7

卷疯了!这个清华系Agent框架开源后迅速斩获1.9k stars,还要“消灭”Prompt?

随着大模型能力突破,Agent 从概念走向应用,各类框架不断涌现。清华系团队发布开源框架 Cooragent,获 1.9k stars。创始人王政分享 Agent 发展洞察,指出大模型能力提升推动 Agent 商业化,还探讨 MCP、框架等多方面问题。

AI前线
产品应用7

AI 播客原理解析

作者分享用豆包AI播客将英文长文转成高质量播客的体验,解析AI把文章变真人对话式语音播客的原理,涉及提示词工程和文字转语音技术,还介绍提示词写作与优化过程及长文处理方法。

宝玉AI
产品应用8

AI世界名画复活走秀爆了,全网疯转!梵高达利莫奈同框谢幕,网友哭崩

国外ODDY工作室借助AI让世界名画及角色复活,打造超写实视频《名作艺术秀》。视频中梵高、达利等大师及作品化身“T台模特”,还有“幕后故事”,带来视觉盛宴,引发网友热议。

新智元