「视觉功能」共找到 2166 篇相关文章
9k星星!知名特效团队开源「完美AI绿幕抠像工具」,8G显存的老Mac都能跑
知名特效团队Corridor Digital开源抠像软件CorridorKey,只需8G显存,N卡和Mac都能跑。它针对复杂边缘和色彩溢出问题提供解决方案,能精准捕捉发丝级细节,功能强大。
开源音视频同步SOTA基座:极简的单流架构,2秒出片
AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。
AI太难学?清华开源一批「学习虾」,免费的AI私教团来了
清华大学开源全球首个多智能体生成式学习AI技术框架OpenMAIC,它能将技术文档转化为零门槛学习课堂,还可解锁多种学习解法。其前身MAIC是重要学习平台,OpenMAIC功能强大,应用场景广泛。
OpenClaw 2026.3.8更新:安全认证及部署回滚能力提升
OpenClaw发布2026.3.8版本更新,聚焦安全性与bug修复。关键更新有ACP来源验证,让代理确认指令来源;更新前自动创建配置快照,可回滚设置。还修复了Telegram重复回复等问题。
让慢SQL消失在提交前:Qoder × RDS AI助手Skill的实时拦截术
在快节奏开发中,SQL 易成‘埋雷’点,问题隐蔽滞后。RDS AI 助手可多方面承接 RDS 使用,通过 Qoder+RDS AI 助手 Skill 能集成其 SQL Review 能力到 AI Coding 流程,3 分钟完成配置。
配置一改就要重启的时代结束了:Dev Proxy 2.1 正式上线
Dev Proxy团队发布2.1版本,围绕开发效率和本地测试体验更新,有配置热重载、stdio流量代理等新功能,还改进配置、性能及细节问题。Dev Proxy Toolkit 1.12同步发布。
第二代AI预训练范式:预测下个物理状态
英伟达科学家Jim Fan发布文章《第二代预训练范式》指出,当前以LLM为代表的AI模型基于「对下一词的预测」,在物理世界应用中「水土不服」,第二代范式应是「预测下一个物理状态」,引发机器学习社区讨论。
AI 驱动的个人理财应用
这是AI驱动的个人理财应用,非记账软件,能像智能助理管钱、自动拆解支出并给建议。支持Docker自行托管,介绍了本地开发环境配置,该应用由Maybe Finance团队开源,此前商业运营未成功。
AAAI 2026 | 北航、东京大学填补AI「语义鸿沟」,过程感知视频理解如何找到「状态」锚点?
北航陆峰教授团队联合东京大学,提出视频理解新框架 TSS,引入“状态”作视觉锚点,解决抽象文本指令与具象视频对齐难题,已被 AAAI 2026 接收,代码已开源。
官方文档翻译:Nano Banana Pro 终极开发指南
本文是 Nano Banana Pro 开发指南,介绍其通过‘思考能力’、实时搜索和 4K 画质构建应用。涵盖在 Google AI Studio 试玩、环境搭建等内容,还给出使用最佳实践与提示词技巧。