「视觉流」共找到 796 篇相关文章
AI世界名画复活走秀爆了,全网疯转!梵高达利莫奈同框谢幕,网友哭崩
国外ODDY工作室借助AI让世界名画及角色复活,打造超写实视频《名作艺术秀》。视频中梵高、达利等大师及作品化身“T台模特”,还有“幕后故事”,带来视觉盛宴,引发网友热议。
让AI主动干活,给你找服务,鸿蒙“6”啊
在HDC 2025上,鸿蒙展示服务分发展示新能力,能让服务主动找用户。它形成Agent行动网络,推出“探索”服务流。奈雪、东方财富等已加入,华为为开发者提供多种工具及激励政策。
ACL 2025|为什么你设计的 Prompt 会成功?新理论揭示大模型 Prompt 设计的奥秘与效能
英属哥伦比亚大学等团队剖析Prompt在LLM的CoT推理中调控模型内部信息流,构建量化Prompt搜索空间复杂度理论框架。研究解释提示有效的原因,提供设计高效提示词思路,实验验证理论框架。
一键抠图有多强?19Kstar 的 Rembg 开源神器,5 大实用场景颠覆想象!
在视觉内容需求旺盛的当下,背景抠图工具至关重要。Rembg 是能在本地完成高质量图片背景抠图的开源利器,累积 19.1K ⭐。本文通过项目详解等带你深度了解它的魅力。
ParScale:一种全新的大模型Scaling Law
文章提出并行扩展(ParScale)路线,在不增模型参数下,通过引入并行流提升性能。新扩展定律打破传统范式,两阶段后训练策略降成本,还适用于边缘设备,研究仍在进行。
清华许华哲:具身智能需要从 ImageNet 做起吗?
清华许华哲探讨具身智能,分析其爆发原因、失败模式及决策点,涉及视觉信号输入、触觉应用、学习方法等,还探讨具身智能是否需‘ImageNet时刻’,并从宏观视角谈智能的共性。
上手“设计界的Manus”,朱啸虎点赞,Lovart这波魔法破圈了丨TIP 002
国产出海产品Lovart被称为“设计界的Manus”,获朱啸虎点赞。它是设计领域首个Agent,能用自然语言驱动生成多模态视觉作品,可生成VI体系、短片等,适合文创领域,还能人工编辑,调用多模型。
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26
大视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国人民大学与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活学安全模式,实验效果好且代码开源。
榨干Codex!OpenAI工程师亲授Codex真正用法
OpenAI客户支持工程师Jason称,Codex不只是编程助手,而是完整电脑工作系统。通过持久对话流留存记忆、语音输入精准表达、自动化接管任务等,能让机器高效完成各类工作,人还可随时干预。
模型声称会“脑补”,结果被论文打脸了?潜在空间想象竟是“摆设”!
多模态大模型中“潜在视觉推理”概念很火,研究者让模型在潜在空间“想象”。但清华和北交学者论文指出,潜在 Token 不关心输入、不影响输出、没信息量。作者提出 CapImagine 方案,效果远超潜在空间方法。