图像风格化」共找到 1326 篇相关文章

开源动态8

结构预处理让DeepSeek准确率提升51%,现已开源丨清华&深言

零成本降低大模型幻觉新方法LingoEDU,让DeepSeek准确率提升51%。它对上下文精准切分,形成篇章结构树。能解决现有方案两难困境,在多方面实验表现出色,有根治幻觉等核心价值。

量子位
算法论文8

北大、字节、中科院自动研究所等提出图像并行生成新范式

北大、字节等团队发现多模态模型先思考后作画会降低图像语义保真度,因自回归架构有误差传播问题。为此提出并行多模态扩散框架MMaDA - Parallel,构建ParaBench基准,多项优后在测试中击败Bagel。

AIGC开放社区
算法论文7

Waver:面向统一图像与视频生成的高性能基础模型

字节提出的Waver是面向统一图像与视频生成的高性能基础模型,支持T2V、I2V、T2I。它引入新架构、结合筛选流程与质量模型。虽有局限,但表现出色,架构设计独特,功能多样。

带你学AI
算法论文8

Agent 护城河:揭秘Harness的三大支柱

上海交大等机构研究者梳理LLM Agent设计逻辑,指出能力正从模型内部流向外部,外部有记忆、技能、协议三大支柱,Harness负责协调,Agent竞争转向外部基础设施。

CourseAI
开源动态8

打破碎片瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑

当前主流相机可控图像编辑基于图像扩散模型,应对连续相机运动易出现问题。近日,浙大联合哈佛发布UniGeo框架,在三核心层面注入统一几何引导,克服结构退,提升视觉质量与跨视角一致性。

新智元
产品应用7

深入体验 A2A SDK:一步步教你构建“服务”的 Agent 系统

文章基于A2A最新Python - SDK,介绍将LangGraph的Agent通过A2A协议对外暴露并服务的方法,涵盖核心架构、概念、交互流程,以及A2A Server端、Client端实现和测试总结,还提及A2A优势。

AI大模型应用实践
产品应用8

刚刚,MiniMax新模型接管「音乐圈」!20秒出歌Cover全风格

4月10日,MiniMax带来重磅更新,上线Music 2.6模型并发布专属Music Skills,核心新功能Cover翻唱可自由进行风格置换。Music 2.6在速度、音乐性和音质上改进明显,还开放三个Music Skills套件。

机器之心
推荐文章8

当我把 AI 变成一个"算法":Skill 工程设计的心路历程

作者分享将 Agent 工程设计的历程。指出 LLM 做 Agent 有痛点,引入 CLI 接管确定性任务和上下文管理,还设计了 Workflow 串联工具,实现自动扩展和无缝互转,最后做 workflow - creator 形成自洽闭环。

腾讯技术工程
推荐文章7

To Agent, not Human

软件开发正从面向人类转向面向Agent。作者将newtype内容生产系统CLI,供Agent使用。当前各种工具CLI,Skill生态爆发,技术栈含CLI、MCP、Skills、Framework四层。

newtype AI
新闻资讯7

OpenAI 宣布启动“全国人工智能教育研究院”:美国K-12教育全面AI

OpenAI宣布与美国教师联合会合作,启动‘全国人工智能教育研究院’,这是为期五年的计划,目标是为全美40万K12教育工作者提供AI培训和支持。OpenAI五年内投入1000万美元,计划在多地建中心。

AI寒武纪