「图像识别」共找到 680 篇相关文章
AI看不到的爱心,成了最棒的AI检测器。
作者以漂浮爱心图检测AI,Gemini 2.5 Pro、GPT - 5等模型均失败。又用噪点鹿视频测试,AI准确率为0%。原因是AI是空间王者、时间瞎子,无“共同命运法则”视觉系统,存在时间盲视。
自媒体误读了 DeepSeek-OCR:一图胜千言
近期,DeepSeek-OCR引发关注,但很多媒体误读其为OCR工具,实际是视觉语言模型。它是为大文档等场景优化的视觉压缩与识别系统,架构新颖,训练讲究,效果出色,为行业带来新思路。
谷歌痛失王座?港科大贾佳亚团队DreamOmni2开源,超强P图暴击Nano Banana
港科大贾佳亚团队开源DreamOmni2,该模型基于FLUX Kontext,能处理多参考图像,在多模态编辑与生成上表现出色,超越谷歌Nano Banana等模型,还构建了新测试集与数据构建范式。
一张照片,一个3D「你」:计算所等提出HumanLift,实现高保真数字人重建
中国科学院计算技术研究所等机构研究人员提出 HumanLift 技术,基于单张参考图像重建高斯网数字人全身。该技术融合三维视频扩散模型和人脸增强,仅需单张人体图片就能重建高逼真三维数字人。
Nature点赞!哈佛MIT最新作:AI科学家时代来了
哈佛MIT推出ToolUniverse,这一开源框架让AI用自然语言操作600+科学工具,解决了科学研究中AI智能体面临的工具格式不统一等问题,推动科研自动化升级,助力打造AI科学家。
NeurIPS 2025 Spotlight | 条件表征学习:一步对齐表征与准则
文章指出传统表征学习处理图片和商品信息时存在局限,针对性有监督训练成本高,多模态大模型使用成本也需考虑。为此提出即插即用的条件表征学习方法 CRL,实验显示其在下游任务表现优异。
让YOLO飞起来:从CPU到GPU的配置指南
文章指出默认安装的YOLO用CPU计算,处理大量图像或实时检测任务效率低。详细介绍将YOLO从CPU模式切换到GPU模式的步骤,对比性能,还给出常见问题解决办法,能显著提升运行效率。
Meta提出Deep Think with Confidence:几乎啥都不用动,就能提升推理的准确性与效率
传统自一致性方法虽能提升推理准确率,但计算开销大、收益递减。Meta AI与UCSD团队提出Deep Think with Confidence(DeepConf),可在不增训练成本和不调超参数下,提升推理准确性与效率,本文对其全面解读。
刚刚,谷歌摊牌:Genie 3让你1秒「进入」名画,人人可造交互世界!
谷歌新发布Genie 3世界模型,能从文本生成交互式AI空间世界,操控图像和视频。用户可进入《苏格拉底之死》《夜游者》等名画探索,还能利用它训练3D模型,实现沉浸式体验。
「2025 AI 实战手册」,年收入破亿的 AI 公司都在干什么?
硅谷 ICONIQ Capital 团队发布 2025 年度「The State of AI」报告,围绕 AI 产品落地,通过问卷收集 300 家 AI 公司高管回答,从开发、定价等五方面剖析 AI 产品端到端流程,还对比了 AI 原生和赋能型公司产品发展。