视觉推理功能」共找到 3979 篇相关文章

开源动态8

Github 9.8K Star真香!!再见黑白屏,这款终端神器让十六进制分析一目了然,效率200%+!

传统十六进制查看器单色显示影响效率,hexyl 基于 Rust 开发,彩色输出区分字节,支持多系统,免费开源获 9.8K Star。它功能多,安装方便,是十六进制分析利器。

开源先锋
开源动态8

字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。

字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。

GitHubStore
开源动态8

Google 开源 InkSight,把手写笔记直接变成可编辑数字笔记!

Google 开源 InkSight,能将手写照片转为数字墨迹,与传统 OCR 不同,它可「还原书写方式」。具备离线转在线、多语言支持等功能,核心是「阅读 + 书写」双重训练,有两种使用模式。

开源星探
算法论文7

ImageNet分数越高,生成反而越糊?iREPA给出解释

Adobe Research论文指出,视觉模型在ImageNet分类准确率高,生成效果未必好,全局语义强易压扁空间结构。iREPA修改REPA训练流程,削弱全局干扰,提升了生成质量。

新智元
开源动态7

5000 star,Harness门槛被OpenHarness打穿了

分享开源Python实现版本OpenHarness,它易上手,能助研究者和开发者理解生产级AI Agent原理、构建专用智能体。介绍其核心功能、架构及核心循环逻辑,还给出了Github链接。

PaperAgent
产品应用7

谷歌放大招!Gemini「吞下」2.5亿地图数据,路痴AI一夜成精

谷歌推出「Grounding with Google Maps」功能,让Gemini接入Google Maps,可调用2.5亿地点信息。本次更新拓展了AI能力边界,适用于多领域,部分Gemini模型支持,还介绍了使用示例。

新智元
开源动态7

无需 OCR 就能从各类文档中提取结构化信息的本地化开源工具docext

docext是无需OCR的本地化开源工具,能从发票、护照等文档图像提取结构化信息。智能文档处理排行榜评估VLMs在多任务表现,docext有灵活提取、表格提取等功能

GitHubStore
新闻资讯8

诺奖获得者Hassabis警告:AlphaGo已觉醒,AGI正接管科研

十年前,AlphaGo击败李世石,让世人看到AI潜力。此后,DeepMind不断推进,其技术从棋盘拓展到科研,如AlphaFold解决蛋白质折叠难题,AlphaProof在数学推理获佳绩,这些成果显示AGI正接管科研。

新智元
开源动态7

当AI小说遇上短视频:这款神器让你1秒变导演!

作者小G推荐开源项目TaleStreamAI,它能将AI小说片段转为电影感短视频,具有全自动处理等功能,官方提供一键安装包,对创作者、程序员等有不同价值,开发者还在招募人员。

GitHubStore
新闻资讯8

突发!Claude 4.5 发布,这次更新不止是模型!

Anthropic发布Claude 4.5,在编程等任务中表现优于GPT - 5。Claude Code升级,API添新功能,模型能力提升,对齐性改善。还推出Claude Agent SDK及“Imagine with Claude”功能

AI进修生