视觉错觉图」共找到 899 篇相关文章

开源动态8

革命性突破!Windows-MCP 开源:AI 助手直接操控实体电脑,告别按键精灵!

在AI驱动的桌面自动化领域,传统工具部署复杂且性能受限。最近GitHub开源的Windows - MCP工具,能让AI助手与Windows UI原生交互,可进行点击、输入等操作,支持Windows 7 - 11,无需传统计算机视觉技术。

开源星探
产品应用8

4K-Agent:可将低分辨率像提升至4K高清智能体

像超分辨率技术在多种视觉任务中重要,但传统方法泛化能力有限。德克萨斯A&M等大学研究人员推出4K Agent,其多智能体架构能将低分辨率像提至4K高清,在多领域测试表现出色。

AIGC开放社区
7

苹果一口咬死AI不会思考!OpenAI前高管直接开怼:AGI已来,别再酸了

苹果论文《思考的错觉》挑战AI推理能力基本假设,引发争议。OpenAI前研究主管则称AGI时代已近。多项研究测试推理模型,指出其有进步也有瓶颈,未来或需换思路,评估方式也待完善。

新智元
新闻资讯7

12年首次大改!真有人喜欢苹果的“液态玻璃”吗?至少Flutter 开发者的噩梦开始了

在 WWDC 2025 上,苹果宣布在多操作系统引入‘液态玻璃’新视觉风格,是 12 年来最大 UI 革新。这或成苹果移动端外观重大转变,但也掩盖其 AI 落后现状,还让开发者面临功耗、适配等挑战。

InfoQ
推荐文章7

Transformer | 一文带你了解Embedding(从传统嵌入方法到大模型Embedding)

文章介绍Embedding基础知识,从传统统计方法到如今大模型用例演变过程。涵盖传统、静态、上下文及大模型Embedding技术,如TF - IDF、word2vec、BERT等,还剖析DS - Qwen1.5B的Embedding并以展示。

AINLPer
算法论文8

夜间感知新突破!北航等提出红外主导的高效目标检测方案 | ECCV'26

在复杂视觉场景中,传统RGB - IR多模态检测方法在低照度等场景下因RGB退化影响检测效果。北航等团队提出的InfraNet,以红外为主,用质量感知机制控制RGB引导,在多数据集取得强竞争力结果。

新智元
算法论文8

从“一句成片”到“长轨推演”:探究多模态智能体在长视频编辑中的应用

近年来大语言模型在长篇视觉叙事中潜力卓越,但长视频剪辑仍难控制。中科大等团队开源工作从系统工程视角研究多模态智能体在长视频编辑中的机制,重构剪辑管线,找到症结并给出解决办法。

量子位
开源动态8

手机跑多模态也能快到飞起!面壁MiniCPM-V 4.6开源

面壁智能开源多模态模型MiniCPM-V 4.6,以低算力成本、超低首Token延迟打通三大主流手机操作系统。它算力瘦身性能强,是视觉语言多面手,还适配主流系统,降本增效,让AI能力从云端到指尖。

AIGC开放社区
算法论文8

ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点

Doc-V*由小米和华中科技大学团队提出,是多页文档理解新范式,通过交互式视觉推理让模型有策略地读长文档。它在多页文档问答基准上比RAG变体提升49.7%,不依赖大模型或长上下文窗口。

机器之心
产品应用8

全球首个世界统一模型发布,机器人家庭成员来了!

自变量机器人发布全球首个世界统一模型架构的具身智能基础模型WALL - B,它打通视觉、听觉等模块,让机器人理解物理世界。还让机器人拥有多能力,通过真实家庭数据形成数据飞轮,助力其融入家庭。

量子位