「全模态生成」共找到 3894 篇相关文章
谷歌Veo 3.1更新:更一致性、更具创造力和控制力
谷歌Veo 3.1发布更新,实现角色、背景与物体在动态场景中的高度一致性,支持基于参考图片创建视频、原生竖屏模式及1080p和4K分辨率升频,精准控制素材,提升创作体验。
Screen Studio的开源免费替代品,自媒体必备的录屏神器,MIT协议可商用。
文章推荐开源屏幕录制工具OpenScreen,它是Screen Studio平替,虽未覆盖全部功能,但基础功能完善,支持双系统,有诸多实用功能,且遵循MIT协议可商用。
一句话画出整张架构图?这款 2k star 开源 AI 画板,真能帮你告别熬夜改流程图吗?
Smart Excalidraw是基于Excalidraw的智能绘图工具,用自然语言就能绘制专业图表。它能解决传统绘图语法难记、排版耗时等痛点,具备AI驱动、独创连接算法等功能,适合多类人群使用。
攻克长文档与多模态挑战,Paper2Video实现学术视频的自动化生产
新加坡国立大学 Show Lab 团队主导研究,提出 Paper2Video 基准及评价指标,还推出 PaperTalker 多智体框架实现学术视频自动化生产,实验显示其在多方面表现佳,效果接近人工水平。
对话 MoonBit 张宏波:为 AI 重构编程语言
文章围绕 MoonBit 语言开发者张宏波展开,探讨为 AI 重构编程语言。指出当前 AI Coding 基于旧有语言有局限,MoonBit 有原生 AI 支持,还介绍其开发历程、特性及 Pilot 工具创新,强调未来商业化愿景。
ChatGPT长了手脚,AI不再是副驾,直接抢过方向盘
OpenAI昨夜发布ChatGPT智能体,它整合网站交互、信息整合、对话交互三项能力,能智能选最优路径完成任务。在多项评估中表现领先,还有多重安全措施。今日向部分用户开放。
拯救P图废柴,阿里上新多模态模型Qwen-VLo!人人免费可玩
昨夜阿里推出全新多模态模型Qwen-VLo,在原有能力上全面升级,有细节捕捉、图像编辑、多语言支持等亮点,不受固定格式限制。官方demo展示多种玩法,目前免费可玩,实测其编辑能力不错。
Cursor入门:MCP开发调用和项目实战
文章介绍Cursor入门,包含MCP开发调用和项目实战。先阐述MCP概念、工作流程,再讲Cursor的Docs、Rules功能。实战部分有开发天气MCP Server和黄金价格预测项目,最后给出使用感受与技巧。
使用 Node.js + OpenAI + MongoDB 实现文本向量知识库搜索
本文介绍用 Node.js、OpenAI Embedding API 和 MongoDB 实现文本向量知识库搜索系统,涵盖环境准备、文本切分与向量存储、本地语义检索等,还提及用 MongoDB Atlas 提升性能及后续延伸方向。
我可太喜欢腾讯会议这个 AI 硬件了,麦克风能换脸
本文是池建强的实测分享,介绍腾讯会议联名影石Insta360推出的AI录音领夹麦,讲解产品功能与使用体验,展示其打通线下线上沟通、对接Agent整合进工作流的玩法。