视觉特征编码器」共找到 792 篇相关文章

新闻资讯7

汉字防AI作弊!甩英文、拉丁文十几条街

中科院等联合发布 Chronicles-OCR 基准测试,让 20 多个主流视觉大语言模型识别汉字演变史。结果显示,模型在古文字识别上表现糟糕,还存在靠认材质作弊情况,暴露了 AI 理解汉字的局限。

CourseAI
新闻资讯8

帮大家总结了一下凌晨的Google I/O 2026开发者大会。

本文总结Google I/O 2026开发者大会成果,涵盖AI模型、产品、Agent系统、视觉生成、搜索、电商等多领域。如推出Gemini 3.5 Flash,升级产品功能,发布新Agent系统,推进电商协议,还有科研成果与硬件更新。

数字生命卡兹克
新闻资讯7

Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了

近日,Anthropic发布研究,描绘AI正替代哪些工作。其构建“实际暴露度”指标,基于Claude对话数据测得。研究列出10大“高危”职业,也指出部分工作不受影响,还揭示高暴露群体特征及青年招聘情况。

AI前线
新闻资讯8

中国科学家首次手搓出“球状闪电”!刘慈欣科幻小说照进现实

4月16日,中科院上海光机所团队在《自然·光子学》发文,首次在实验室可控生成具球状闪电典型特征的宏观电磁孤子。其存活时间长、空间尺寸大,还能为研究提供受控平台,有潜在应用价值。

DeepTech深科技
7

1.4亿宝可梦玩家,都在给AI免费打工…

1.4亿《精灵宝可梦Go》玩家10年拍300亿张实景图,为Niantic免费收集数据。Niantic用此数据训练VPS视觉定位系统,提升机器人配送效率,还获巨额投资,剥离游戏业务专注空间AI。

量子位
新闻资讯7

从宁波到登陆港交所,“边缘AI芯片第一股”的突围之路

2月10日,爱芯元智登陆港交所,被誉为“中国边缘AI芯片第一股”。它以“混合精度NPU”与“AI - ISP”为核心技术,构建产品矩阵。营收增长强劲,客户基础拓宽,应用领域广泛,在行业中排名靠前,但也面临挑战。

芯师爷
推荐文章8

创业者思考:如何做 AI Agent 喜欢的基础软件?

作者黄东旭指出Infra软件主要使用者正从开发者转向AI Agent,以TiDB Cloud为例说明趋势已现。他探讨如何做AI Agent喜欢的基础软件,从心智模型、接口设计、必要特征、商业模式等方面给出建议。

Founder Park
产品应用8

GPT-5.2首发评测:大神深度体验两周,强到离谱,但慢得抓狂

为对抗谷歌的Gemini 3,OpenAI推出GPT - 5.2。大神Matt Shumer深度评测,指出其指令遵循、代码生成、视觉和长上下文等能力有提升,但速度慢。与Claude Opus 4.5、Gemini 3 Pro各有分工。

AI寒武纪
算法论文8

首帧的真正秘密被揭开了:视频生成模型竟然把它当成「记忆体」

UMD、USC、MIT研究团队发现视频生成模型会把首帧当作‘概念记忆体’,将视觉实体存于首帧并在后续复用。基于此提出轻量方法FFGo,用少量例子让模型实现SOTA级视频定制。

机器之心
产品应用8

英伟达拿出推理版VLA:Alpamayo-R1让自动驾驶AI更会动脑子

当今自动驾驶模型虽强大,但在‘长尾场景’易翻车。英伟达推出的Alpamayo - R1是带推理能力的视觉 - 语言 - 行动模型,有核心创新,实验中性能显著提升,训练分三阶段,让自动驾驶迈向可解释。

机器之心