文档视觉编码器」共找到 1290 篇相关文章

产品应用7

人形机器人终于学会洗碗了

Figure机器人学会洗碗,用的是叠毛巾和分包裹同款Helix架构,无新算法和特殊工程,仅增加新数据。该架构是端到端“视觉 - 语言 - 动作”模型,同一系统增数据就能学新技能。

量子位
算法论文8

首个3D动作游戏专用VLA模型,打黑神话&只狼超越人类玩家 | ICCV 2025

淘天集团未来生活实验室团队提出首个3D动作游戏专用VLA模型CombatVLA,已被ICCV 2025接收。它能处理视觉输入输出动作指令,在战斗理解准确率和执行速度上表现优异,还构建了评测基准等。

量子位
开源动态8

吞下17亿图片,Meta最强巨兽DINOv3开源!重新定义CV天花板

Meta训出70亿参数「视觉巨兽」DINOv3并完全开源。它用自监督学习,无需人工标注,可生成强大图像特征,在多任务超专用方案,NASA已用其探索火星,还能推动多行业进步。

新智元
推荐文章7

我的空白页恐惧症,被AI治好了

作者分享摆脱空白文档恐惧的经验,认为可让AI先写初稿,人与AI协同创作。以百度文库Genflow 2.0为例,展示其在资料导入、任务执行等方面优势,鼓励大家尝试与AI协作。

花叔
算法论文8

联合理解生成的关键拼图?腾讯发布X-Omini:强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像

图像生成领域,自回归与扩散模型技术路线之争不断。腾讯混元团队发布X-Omni模型,通过强化学习提升自回归图像生成质量,能渲染长文本图像。该模型已开源,还构建奖励系统评估生成质量。

机器之心
新闻资讯7

GPT-5问题太多,奥特曼带团回应一切,图表弄错是因「太累了」

GPT - 5发布后问题频出,在数学、逻辑、编码任务中失误不断,还出现低水准图表错误,引发吐槽质疑。OpenAI联合创始人Sam Altman等在Reddit AMA活动中回应问题,给出解决方案并分享未来规划。

机器之心
新闻资讯8

OpenAI刚刚发布GPT-5,免费使用、疯狂屠榜,一夜改写AI历史

今天凌晨1点,OpenAI发布GPT - 5,采用内嵌式三位一体集成架构,有创新的实时决策路由机制。免费版ChatGPT可使用,有额度限制。测试显示其在多领域大幅超越前代,应用开发能力强,今日向部分用户推出。

AIGC开放社区
算法论文8

ICML2025 | 揭示MLLM的图文联动推理能力

当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。

深度学习自然语言处理
算法论文8

单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码

人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。

新智元
产品应用7

太牛了~~复杂表格Cell合并、跨页拼接,中文领域96%,甩MonkeyOCR 20%

在PDF文档解析领域,复杂表格解析是难题。今天分享的OCRFlux是基于qwen2.5vl - 3B模型微调的解决方案,有单页解析和跨页段落/表格合并等创新点,测试得分超96%,远超MonkeyOCR等。

PaperAgent