全模态生成」共找到 3894 篇相关文章

产品应用8

谷歌Veo 3.1更新:更一致性、更具创造力和控制力

谷歌Veo 3.1发布更新,实现角色、背景与物体在动态场景中的高度一致性,支持基于参考图片创建视频、原生竖屏模式及1080p和4K分辨率升频,精准控制素材,提升创作体验。

AIGC开放社区
开源动态7

Screen Studio的开源免费替代品,自媒体必备的录屏神器,MIT协议可商用。

文章推荐开源屏幕录制工具OpenScreen,它是Screen Studio平替,虽未覆盖部功能,但基础功能完善,支持双系统,有诸多实用功能,且遵循MIT协议可商用。

开源AI项目落地
开源动态8

一句话画出整张架构图?这款 2k star 开源 AI 画板,真能帮你告别熬夜改流程图吗?

Smart Excalidraw是基于Excalidraw的智能绘图工具,用自然语言就能绘制专业图表。它能解决传统绘图语法难记、排版耗时等痛点,具备AI驱动、独创连接算法等功能,适合多类人群使用。

小华同学ai
算法论文8

攻克长文档与多模态挑战,Paper2Video实现学术视频的自动化生产

新加坡国立大学 Show Lab 团队主导研究,提出 Paper2Video 基准及评价指标,还推出 PaperTalker 多智体框架实现学术视频自动化生产,实验显示其在多方面表现佳,效果接近人工水平。

机器之心
产品应用7

对话 MoonBit 张宏波:为 AI 重构编程语言

文章围绕 MoonBit 语言开发者张宏波展开,探讨为 AI 重构编程语言。指出当前 AI Coding 基于旧有语言有局限,MoonBit 有原生 AI 支持,还介绍其开发历程、特性及 Pilot 工具创新,强调未来商业化愿景。

AI科技评论
产品应用8

ChatGPT长了手脚,AI不再是副驾,直接抢过方向盘

OpenAI昨夜发布ChatGPT智能体,它整合网站交互、信息整合、对话交互三项能力,能智能选最优路径完成任务。在多项评估中表现领先,还有多重安措施。今日向部分用户开放。

AI工程化
产品应用8

拯救P图废柴,阿里上新多模态模型Qwen-VLo!人人免费可玩

昨夜阿里推出新多模态模型Qwen-VLo,在原有能力上面升级,有细节捕捉、图像编辑、多语言支持等亮点,不受固定格式限制。官方demo展示多种玩法,目前免费可玩,实测其编辑能力不错。

量子位
推荐文章7

Cursor入门:MCP开发调用和项目实战

文章介绍Cursor入门,包含MCP开发调用和项目实战。先阐述MCP概念、工作流程,再讲Cursor的Docs、Rules功能。实战部分有开发天气MCP Server和黄金价格预测项目,最后给出使用感受与技巧。

阿里云开发者
产品应用7

使用 Node.js + OpenAI + MongoDB 实现文本向量知识库搜索

本文介绍用 Node.js、OpenAI Embedding API 和 MongoDB 实现文本向量知识库搜索系统,涵盖环境准备、文本切分与向量存储、本地语义检索等,还提及用 MongoDB Atlas 提升性能及后续延伸方向。

AI Reading Hub
产品应用8

我可太喜欢腾讯会议这个 AI 硬件了,麦克风能换脸

本文是池建强的实测分享,介绍腾讯会议联名影石Insta360推出的AI录音领夹麦,讲解产品功能与使用体验,展示其打通线下线上沟通、对接Agent整合进工作流的玩法。

MacTalk