「统一语义层」共找到 924 篇相关文章
锁定角色,「多主体」也可控!个性化文生图,给你PS般交互体验
LayerComposer革新个性化图像生成,能让用户如在Photoshop般操控元素位置、大小,解决传统方法交互性与多主体扩展难题。它有分层画布、锁定机制、模型–数据共设计三大特点,实验表现出色,未来将促进人机协同创作。
根治『降智』反骨仔,ChatGPT-5几条实用窍门
ChatGPT-5发布后口碑崩溃,“降智”行为不断,如发布会图表错误、算术题答错、智商测试得分低。不过作者找到增智方法,像修改提示词、让其建立行动规划等,还介绍恢复旧模型及OpenAI后续计划。
从捍卫者到引路人,上交&上海AI Lab提出LEGION:不仅是AI图像伪造克星,还能反哺生成模型进化?
AIGC技术发展使AI图像滥用问题严重,公众面临信任危机。上交与上海AI Lab等团队在论文中从构建数据集、设计模型、实现检测与生成统一三方面破局,LEGION能检测伪造,还可反哺生成模型进化。
Transformer危!谷歌MoR架构发布:内存减半推理速度还翻倍
谷歌推出全新底层架构Mixture-of-Recursions(MoR),推理速度提高2倍、KV内存减半,首次在单一框架实现多任务处理与动态分配计算资源,研究人员通过实验验证其性能超Transformer。
TransDiff--最简洁的AR Transformer + Diffusion图像生成方法
文章分享图像生成新方法TransDiff,它结合AR Transformer与Diffusion,提出MRAR范式。通过Q&A解答其使用Transformer原因、小Diffusion Deocder效果等问题,还指出它有连续帧生成潜力,将用于视频生成。
押中 Figma、Scale AI 的 Thiel Fellowship, 今年下注哪些 AI 方向?
Thiel Fellowship 由 Peter Thiel 2011 年创办,为入选者提供资金与支持。2025 年入选者地域更广,项目聚焦 AI 等领域。热门方向有 AI Infra、金融 Infra、可编程生命系统,创始人年轻、跨界、实验性强。文中还介绍了多个亮点项目。
字节开源了一个了不得的模型!
字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。
大模型系统提示词逆向(2)—— Cursor
作者研究大模型提示词注入时,用简单提示词“骗”出 Cursor 系统提示词。文中分析提示词生效原理、对 Cursor 有效的原因,还提及提示词泄露的安全问题及开发者应对建议。
DeepMind 提出 CaMeL,抵御 LLM 提示词注入
谷歌DeepMind研究人员提出CaMeL,作为围绕LLM的防御层,通过提取查询中的控制流和数据流阻止恶意输入,能在AgentDojo基准测试中抵御67%攻击,采用传统软件安全原则。
同一模型便宜50%,API Hub靠什么赚钱?
文章探讨大模型API Hub低价卖Token现象,指出低价出售的常是闲置算力等。分析厂商不官网降价原因,介绍第三方低价来源及Hub盈利途径,给出判断低价Hub能否用的检查清单。