「多图像空间推理」共找到 2783 篇相关文章
让扩散模型「可解释」不再降质,开启图片编辑新思路
过去三年扩散模型席卷图像生成领域,但可解释性研究是‘黑箱’,且现有尝试常致性能下降。香港中文大学与上海人工智能实验室团队提出TIDE框架,可解释且不降质,还带来新图像编辑方式。
打工15年,被大厂裁4次了
美国老李15年被微软、Meta、苹果等大厂裁4次。2025年众多科技公司裁员,AI推动岗位变革,企业用懂AI员工换不懂的。失业潮全球都有,有人转型成功,老李最终入职丰田子公司。
强化学习 AI 系统的设计实现及未来发展
本文是阿里巴巴算法专家曹宇在 AICon 2025 北京站的分享,结合算法实践展示 RL 系统现状及发展脉络,探讨未来超大规模 RL 发展方向,涉及理论基础、业界实践、开源生态及社区共建。
Meta这两篇最新Agent Learning论文,有些意思!
分享Meta SuperLabs两篇Agent Learning论文,从‘如何低成本获得高质量经验’出发,形成技术链,为语言智能体进入‘规模化RL时代’提供路线图,还分析了Agent RL问题及两论文成果、对比。
藏师傅 Kimi K2 Thinking 首测!教你用 Kimi 编程全家桶
本文首发测评藏师傅 Kimi K2 Thinking,介绍 Kimi 编程全家桶。K2 Thinking 有 Agent 化等多方面升级,还推出 Kimi CLI 工具与 KFC 套餐。作者展示全家桶使用方法并多维度测试,肯定其表现,赞 Kimi 战略清醒务实有远见。
EMNLP 2025 Oral|检索增强 + 两阶段微调:剑桥提出有害内容检测大模型RA-HMD,性能SOTA
多模态有害信息检测是网络内容安全治理的重难点,多模态模型在有害内容检测上有瓶颈。剑桥大学团队提出RA - HMD框架,通过两阶段微调与结构增强,结合检索增强,提升检测性能,被EMNLP 2025接收。
当AI无所不能,你如何不可替代?
硅谷裁员潮,AI 普及让职场人焦虑被替代。《太稳不太稳》直播中,万维钢与霍太稳探讨人类核心竞争力,指出人类主动性等是 AI 无法复制的价值,还给出各职业应对建议及用 AI 提效方法。
多模态大模型理解物理工具吗?PhysToolBench提出了衡量多模态大模型对物理工具理解的基准
香港科技大学等团队提出 PhysToolBench,用于衡量多模态大模型对物理工具的理解。它将理解分为三个等级,测试 32 个模型,揭示了大模型在工具理解上的不足,也为未来发展指明方向。
ACM MM 2025 Oral | 新加坡国立大学提出FractalForensics,基于分形水印的主动深度伪造检测与定位
近些年来,深度伪造主动防御受关注,但现有方法有鲁棒性不稳定等问题。新加坡国立大学等团队提出 FractalForensics 方法,基于分形水印实现主动深度伪造检测与定位,实验效果良好。
承包你的品牌营销物料|谷歌再发重磅 AI 设计产品
谷歌实验室发布AI设计产品Pomelli,专注帮企业低成本生成符合品牌调性的营销物料。它能提取官网品牌元素创建DNA卡片,依此生成设计稿,还能微调细节。不过,它依赖官网信息,存在美学单调等问题。