视觉框架」共找到 2190 篇相关文章

算法论文8

首个3D动作游戏专用VLA模型,打黑神话&只狼超越人类玩家 | ICCV 2025

淘天集团未来生活实验室团队提出首个3D动作游戏专用VLA模型CombatVLA,已被ICCV 2025接收。它能处理视觉输入输出动作指令,在战斗理解准确率和执行速度上表现优异,还构建了评测基准等。

量子位
开源动态8

吞下17亿图片,Meta最强巨兽DINOv3开源!重新定义CV天花板

Meta训出70亿参数「视觉巨兽」DINOv3并完全开源。它用自监督学习,无需人工标注,可生成强大图像特征,在多任务超专用方案,NASA已用其探索火星,还能推动多行业进步。

新智元
算法论文8

推理即排序:ReasonRank反常识的2.7倍效率跃迁,新SOTA比快更快

论文提出新型排序模型ReasonRank,将深度推理能力融入排序流程,突破数据瓶颈,采用创新训练框架,效率比主流点对点排序模型快2.7倍,还介绍方法论、技术突破、实验验证等内容,指出局限与未来方向。

深度学习自然语言处理
开源动态7

以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能

dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。

PaperAgent
算法论文8

联合理解生成的关键拼图?腾讯发布X-Omini:强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像

图像生成领域,自回归与扩散模型技术路线之争不断。腾讯混元团队发布X-Omni模型,通过强化学习提升自回归图像生成质量,能渲染长文本图像。该模型已开源,还构建奖励系统评估生成质量。

机器之心
算法论文8

ICML2025 | 揭示MLLM的图文联动推理能力

当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。

深度学习自然语言处理
算法论文8

直播预约 | SwS: 强化学习训练能否不依赖外部知识优化模型的弱点?

该论文提出强化学习场景下的启发式数据合成流程(SwS),利用模型自我感知弱点驱动自动化问题生成,弥补推理缺陷。对其扩展后适应性更广,在多基准测试集和模型上验证有效,性能提升显著。

深度学习自然语言处理
Product Application7

PDF难点解析:处理复杂表格、水印、印章、复选框、信息抽取等7项任务,6大能力

文章介绍Nanonets - OCR - s可处理关键信息提取、视觉问答等7项任务,具备LaTeX方程识别、图像描述等6项能力,还给出体验链接。但测试发现英文体验优于中文,模型有重复输出、幻觉严重问题。

CourseAI
开源动态8

揭秘开源Agentic‑Doc真能支撑120 W+ 查询?医疗/金融/法务都在用,确实是有这么 6~~~

LandingAI的Agentic Document Extraction是领先OCR且具视觉结构化能力的Python SDK,可处理复杂文档。它功能丰富,架构合理,支持多格式输出。在多行业有应用,性能提升显著,与同类项目相比优势明显。

小华同学ai
开源动态8

突破传统检索瓶颈!阿里通义实验室发布 WebDancer,开启多步推理智能体新范式!

在信息爆炸时代,传统检索技术缺乏动态决策能力,难以满足多步推理需求。阿里通义实验室发布的 WebDancer 基于 ReAct 框架,通过四阶段构建,在测试中表现优异,未来规划拓展工具生态、突破任务边界等。

开源星探