「视觉生成调优」共找到 2740 篇相关文章
最火、最全的Agent记忆综述,NUS、人大、复旦、北大等联合出品
多所顶级学术机构联合发布百页综述《Memory in the Age of AI Agents: A Survey》,为‘Agent Memory’梳理技术路径。提出三角框架,辨析与其他概念差异,还探讨记忆形式、功能、运转机制,展望未来发展方向。
太魔幻了!刚刚OpenAI发布GPT Image 1.5:Nano Banana Pro 王座不保
OpenAI发布由GPT Image 1.5驱动的新版ChatGPT Images。新模型核心升级体现在精准修图、指令遵循能力强、生成速度提升4倍。还推出Images主页,API上线且价格降20%,适合企业。
还在手搓PPT?试完这款AI,我连夜卸载了付费模板库
新智元报道,今年AI从「卷分数」变为「卷干活」。商汤升级的「办公小浣熊3.0」是超级「办公搭子」,能做PPT、分析数据、写报告。其APP即将上线,还实现全链路国产化适配。
杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切争议
上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,引发广泛关注。今日凌晨,杨植麟等团队成员在 Reddit 开展 AMA 活动,回应 K2 Thinking 相关问题,如 KDA 机制应用、训练成本、速度与准确性平衡等。
谷歌Nano Banana 2 来了,图片AGI提前到来?
伴随Gemini 3、GPT 5.1小道消息,谷歌Nano Banana 2提前到来。它采用多步骤生成流程,有自我纠错循环,能替代部分Photoshop功能,在细节、配色等方面比一代提升明显,即将正式上线。
实战·Agentic 上下文工程(上):无需微调,让智能体自我学习与进化
在Agent时代,提示工程进化成上下文工程。斯坦福等团队提出Agentic Context Engineering(ACE),让智能体自我学习与进化。文章介绍了上下文工程的必要性、定义、常见策略,以及ACE的概念、原理与架构。
打造图像编辑领域的ImageNet?苹果用Nano Banana开源了一个超大数据集
苹果研究团队提出Pico - Banana - 400K数据集,基于Nano - Banana在OpenImages实拍照片生成编辑对。其系统化设计保证质量与多样性,还构建自我编辑评估流程,为图像编辑模型训练评测奠定基础。
超越Runway!Adobe发布新神器:P视频比P图还简单
Adobe联合多高校推出AI模型EditVerse,它将图片和视频编辑整合,解决传统视频编辑复杂、数据稀缺问题。通过通用视觉语言、上下文学习能力和知识迁移,其效果超Runway,还展现涌现能力。
RAG新王:AccurateRAG屠榜SOTA
大模型记不住私有或实时信息,RAG 落地遇难题。AccurateRAG 是 Qualcomm 团队端到端工程方案,有 4 个模块化组件,在 6 个数据集上刷新 SOTA,解决 RAG 文档解析、检索和生成难题。
AI版抖音来了
OpenAI发布Sora 2及专门APP,被称为AI版抖音。Sora 2在逼真度和物理准确性上有极大提升,APP玩法独特,让大量真实人物与虚拟场景结合。虽仅在美加开放且需邀请码,但闲鱼已有售卖。