「生成式模型」共找到 9021 篇相关文章

开源动态7

8秒极速生成!复杂场景图像定制低成本轻松驾驭,已开源丨字节北大联合发布

字节跳动与北大联合推出支持多条件组合的统一图像定制化生成框架DreamO,能实现主体、身份等多样化定制。与商业大模型比,它开源、成本低、速度快,8 - 10秒可完成图片定制。

量子位
新闻资讯7

The Batch: 973|Claude 的水印如何运作

Anthropic将在2026年8月2日后发布的Claude模型全球部署肉眼不可见、机器可读的水印,用于表明文本和图像由其生成。该技术基于Google的SynthID - Text,不过此公告引发广泛争议。

DeeplearningAI
开源动态8

8.6K star!!实时翻译、离线使用、支持50+语言,这个免费开源项目牛皮!

介绍开源项目RTranslator,它为Android平台实时翻译应用,用Meta的NLLB模型与OpenAI Whisper技术,本地处理保障质量与隐私。有双模式对话等功能,在Github获8.6K star。

开源先锋
产品应用8

教机器人干活,光“刷课时”可不够!灵初这次较真数据质量

本文聚焦机器人学习人类操作的数据痛点,灵初智能提出逆向生成强配对数据的新思路,升级Psi-R2.5模型,提升数据可用性,降低新任务适配成本,方案已落地客户现场。

量子位
算法论文8

Thinking with Video:一种全新的思考范式

在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。

深度学习自然语言处理
产品应用7

首发丨手机的『魔法挂件』,实测钉钉dingtalk A1,有用的好帮手

2025年基于大模型的AI硬件焕发生机,钉钉dingtalk A1是其中代表。它厚度仅3.8mm,使用方便,具备会议录音转写、纪要生成、通话分析等功能,还能用于学习和生活场景。

鲸选AI
算法论文8

北航LiveRepoReflection: 扭转乾坤-仓库级代码反射

本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。

PaperAgent
产品应用8

B站发布最强零样本TTS,IndexTTS2情感可控、时长精准

在大规模TTS系统中,自回归模型难精准控制语音时长。Bilibili推出IndexTTS2,支持两种生成模式,实现情感表达与音色解耦,引入GPT潜在表示,设计‘软指令’机制,降低情绪控制门槛。

带你学AI
开源动态8

智源新出OmniGen2开源神器,一键解锁AI绘图「哆啦 A 梦」任意门

2024年9月智源研究院发布统一图像生成模型OmniGen,获社区好评。近期OmniGen升级为OmniGen2,增强多方面能力且全面开源。它采用新架构与策略,有反思机制,玩法丰富,还推出新基准优化部署。

机器之心
算法论文8

CVPR2025|MCA-Ctrl:多方协同注意力控制助力AIGC时代图像精准定制化

中国科学院计算技术研究所团队提出无需微调的通用图像定制方法 MCA - Ctrl,利用扩散模型内部知识,结合条件语义与主体内容。实验显示其在编辑和生成任务表现优,解决了现有技术瓶颈。

机器之心