视觉错觉图」共找到 897 篇相关文章

算法论文8

港科大&北京人形提出LOVON:足式机器人开放世界全域目标追踪新范式!

港科大广州联合北京人形创新中心推出LOVON框架,融合大语言模型、开放词汇视觉检测和语言 - 运动映射模型,解决足式机器人开放世界全域目标追踪难题,有抗干扰视觉处理等优势,性能超传统方法。

机器之心
开源动态8

GitHub连续霸榜,难怪别人的表这么高级优雅!

作者让AI画系统架构效果不佳,朋友推荐diagram-design项目。它是给Agent用的出技能包,能让AI生成编辑级质量表,有多种表类型,具备诸多亮点功能,还介绍了安装使用方法。

开源先锋
产品应用7

LibTV这个邪修功能,大大减少AI视频抽卡次数!

作者分享在LibTV用「深度动作捕捉」功能做AI视频,将视频动作提取成深度,可减少AI视频生成失败率,且不花积分,深度管几何,提示词管外观,提一次能用多次。

花叔
开源动态7

「看」能否取代「读」,为何DeepSeek-OCR 爆火的重点不在性能?

DeepSeek近期开源的DeepSeek - OCR在AI社区引发热议。它提出‘上下文光学压缩’理念,以视觉方式压缩文本。社区关注重点在其研究思路对NTP范式的影响,有望解决长上下文经济性难题等。

机器之心
产品应用7

藏师傅教你用 Nano Banana 编辑片做手办

前几天发 Nano Banana 测评后,很多人不知怎么用。刚好做手办玩法火了,作者教大家在 LM Arena 用 Nano Banana 编辑片、做手办,还介绍把片变视频及剪辑的方法。

歸藏的AI工具箱
开源动态8

准确率92.7%逼近Claude 3.5、成本降低86%,开源代码定位新神器LocAgent来了

OpenHands 等团队发布 LocAgent,这是用于代码定位的索引 LLM Agent 框架,准确率达 92.7%。它把代码库解析成,提供工具接口,经实验效果出色,开源微调模型降本增效,还能提升问题解决率。

机器之心
算法论文8

清华联手快手可灵,撞车谢赛宁团队RAE,用SVG再证明VAE已过时

AI像生成正告别VAE技术。清华与快手可灵联合提出SVG方案绕开VAE,纽约大学谢赛宁团队也提出RAE模型。SVG用自监督特征构建潜空间,在质量、效率和通用性上超传统,证明统一视觉模型可行。

AIGC开放社区
产品应用8

DeepSeek睁开眼了!Opus-4.8的性能,1000张不到20美分

DeepSeek首个多模态视觉模型deepseek-v4-flash-vision-exp上线DeepSeek API平台。文本能力与V4-Flash持平,多模态Agent能力逼近Opus-4.8,分析1000张成本不到20美分,还上线免费Files API。

AIGC开放社区
算法论文8

ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字与像在统一架构中共同演化

NUS、ZJU 等联合提出「ThinkMorph」,主张文字与像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。

机器之心
新闻资讯7

4万多名作者挤破头,CVPR 2025官方揭秘三大爆款主题, 你卷对方向了吗?

CVPR 2025 官方根据 4 万多名作者 13008 份投稿,总结出计算机视觉热门的三大方向,即基于多视角与传感器的 3D 技术、像与视频合成、多模态学习(视觉、语言和推理),并介绍了各方向热门原因。

机器之心