多参考图」共找到 4429 篇相关文章

开源动态8

CVPR 2026 | 谷歌DeepMind重磅开源模态TIPSv2:实现Patch-Text对齐的最优表现

谷歌DeepMind推出模态TIPSv2,解决像块与文本嵌入对齐难题。它有三大核心技术创新,在9项任务和20个数据集表现出色,特征优势显著,且配套生态完善,为AGI预训练指明方向。

机器之心
算法论文8

竞赛编程Agent进入全球前十!南大、清华新模型CF rating超3500

大语言模型在竞赛编程场景易失败。南大、清华等研究者提出Solvita框架,由四个角色形成闭环,构建可训练结构知识网络积累经验。实验显示其在评测中表现强,提升不靠增加token。

新智元
新闻资讯8

Altman 亲自坐镇发布 ChatGPT Image 2,小编实测:风格、画质、叙事感全都夯爆了

OpenAI CEO Sam Altman 亲自发布 ChatGPT Images 2.0,这是该公司迄今功能最强的像生成模型。它有思考能力,可直出 8 张连贯片,支持语言、种画幅与分辨率,能精准执行复杂指令,直接商用也没问题。

InfoQ
开源动态7

下一代架构设计工具,说话就能画

next-ai-draw-io是开源项目,用自然语言描述就能让AI自动生成draw.io格式的。有文字生成表等核心功能,技术栈用Next.js + AI SDK + react-drawio,支持提供商,还介绍了安装、部署方法。

GitHubStore
算法论文8

SIGIR 2025 | 解决扩展和迁移难题,华为新加坡提出InstructRAG,提升高达19%

大语言模型任务规划面临可扩展性和可迁移性挑战,华为新加坡团队提出 InstructRAG 方案,通过智能体协同架构实现指令扩展与少样本任务迁移,在数据集测试中性能提升高达 19.2%。

机器之心
产品应用7

赛博鸡生蛋,7小时用Claude Vibe Coding一个Mini-Claude

本文是小白向文章,用Vibe Coding方式参考Claude实现精简版Mini-Claude。介绍开发流程,含打通LLM API调用、完成tool use调用等步骤,还提及后续待做事项及对AI开发的思考。

阿里云开发者
产品应用7

Seedance 2.5 专业创作实测:3D导演台、局部重改、角色库如何释放模型能力

Seedance 2.5升级,3D导演台自带片生成白模功能、打通3D工作流;有片段重拍实用功能;小云雀升级角色资产能力。除素材增加,其更理解原视频创意逻辑,还有模态参考等功能,降低创作门槛。

AI进修生
产品应用8

将科研脏活累活真·丢给AI!上海AI Lab推出深度科研智能体FlowSearch

上海人工智能实验室推出深度科研智能体FlowSearch,它由动态结构化知识流驱动,有三大核心模块。在个科研基准上性能领先,能让科研更高效,标志科研智能体迈向新阶段,还为未来系统奠定基础。

量子位
产品应用8

对普通人最有用的一次!藏师傅教你用FLUX Kontext解决一切片问题

黑森林工作室发布生成式流匹配模型 FLUX Kontext,它能编辑片且不影响未编辑区域,支持参考生成新像。可用于去水印、修复照片、修改海报、生成商品展示等,还能美颜美体,替代 PS 等工具。

歸藏的AI工具箱
开源动态8

50个Agent分工干活,Kimi K2.5的Agent“军团”把我看呆了。。。

Kimi K2.5今日下午发布并开源,具备模态能力。它能根据视频、链接等复刻网站,有Visual Edit功能且自动部署上线。还有Agent Swarm场景,Agent协作解决复杂问题,应用体验佳。

探索AGI