文本到图像生成」共找到 2669 篇相关文章

算法论文8

精准调控大模型生成与推理!浙大&腾讯新方法尝试为其注入“行为定向剂”

ACL 2025中选论文里,浙大与腾讯联合团队提出STA方法,深入模型内部分析神经元激活模式,干预关键神经元,抑制有害行为、保留通用性能,还在多模型实验验证效果,并将部分方法开源。

量子位
算法论文8

DiffMoE:动态Token选择助力扩散模型性能飞跃,快手&清华团队打造视觉生成新标杆!

清华大学和快手可灵团队推出DiffMoE,通过创新的动态token选择机制和全局token池设计,拓展了扩散模型的效率与性能边界。实验表明,DiffMoE在多方面超越现有模型,未来集成先进技术或有新增益。

机器之心
算法论文8

TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的

该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。

深度学习自然语言处理
算法论文8

Speech LLM 的下一个突破口:你的语音大模型可以是个「带韵律的文本模型」

语音大模型存在‘模态代沟’致性能‘降智’,此前两波改进未根本解决。香港中文大学论文提出TextPro - SLM架构,从输入端破局,仅用约1000小时数据就实现低‘模态代沟’,对多模态模型设计有启发。

机器之心
新闻资讯7

AI生成内容如何确权?全国首部区块链知识产权存证标准启动编制,欢迎参与起草!

区块链存证技术能解决知识产权确权、举证、维权难题,但实践中存证流程不规范等问题凸显。全国首部《基于区块链的知识产权存证管理规范》团体标准立项,正征集起草单位和起草人,可解决企业核心困境。

AI寒武纪
产品应用7

Google 推出了免费 Vibe Coding 工具,一键集成聊天、视频、图像AI,真的很氛围。

谷歌推出免费 Vibe Coding 工具,集成多种 AI 功能。谷歌 AI Studio 的 Built 模式更新,能混合匹配 AI 功能,自动连接模型和 API。用户无需了解 API 文档,可快速做出 MVP,谷歌 AI API 免费(限速)。

AI进修生
产品应用7

RAG性能优化:基于RAGFlow自定义解析工具实现文本结构化(含源码教学)

文章围绕RAG性能优化展开,指出RAGFlow框架中DeepDoc解析算法不足,介绍开源与商业化解析工具优劣势及API调用和本地部署特点,推荐TextIn xParse,给出RAGFlow+TextIn知识库构建方法,还探讨了RAG优化方案。

AINLPer
产品应用8

PosterGen:告别学术海报制作烦恼,从PDF一键生成「演示级」可编辑PPTX学术海报

许多研究者制作学术海报耗时费力,现有自动化方法有缺陷。联合团队推出PosterGen,能将论文PDF转成可编辑PPTX海报。它有核心创新,遵循四大设计原则,工作流由四个智能体构成,实验证明其有效。

机器之心
推荐文章7

“都什么年代了程序员还在手搓代码,连小白都能写 Prompt 生成代码了”

现在很多人标榜用 AI 写代码高效,贬低手搓代码。作者认为两者都是写代码的手段,不是目的,不能对立。并从多方面分析适合 AI 或手搓代码的场景,强调二者搭配使用能事半功倍。

宝玉AI
开源动态8

重新定义检索!一款真正“跨模态”的 RAG 模型来了!用音频搜视频、文本找音乐!

传统RAG有速度慢、细节丢失等问题。Vidore开源的ColQwen - Omni 3B多模态RAG模型,支持跨模态检索,能直接处理音视频原始数据,保留细节,检索速度快,还具备轻量高效等特性,适用于多场景。

开源星探