视觉几何基准」共找到 1510 篇相关文章

开源动态8

吞下17亿图片,Meta最强巨兽DINOv3开源!重新定义CV天花板

Meta训出70亿参数「视觉巨兽」DINOv3并完全开源。它用自监督学习,无需人工标注,可生成强大图像特征,在多任务超专用方案,NASA已用其探索火星,还能推动多行业进步。

新智元
开源动态7

以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能

dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。

PaperAgent
算法论文8

联合理解生成的关键拼图?腾讯发布X-Omini:强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像

图像生成领域,自回归与扩散模型技术路线之争不断。腾讯混元团队发布X-Omni模型,通过强化学习提升自回归图像生成质量,能渲染长文本图像。该模型已开源,还构建奖励系统评估生成质量。

机器之心
算法论文8

图灵奖得主Sutton再突破:强化学习在控制问题上媲美深度强化学习?

图灵奖得主Richard S. Sutton认为未来AI发展需靠强化学习。他将2024年的SwiftTD算法拓展到控制领域,提出Swift - Sarsa算法,还设计操作性条件反射基准测试。实验显示,结合预处理方法,其性能或媲美深度强化学习。

机器之心
算法论文8

ICML 2025 | 大模型能在信息不完备的情况下问出正确的问题吗?

当前大语言模型推理研究多聚焦被动推理,主动推理研究少,制约其在现实场景应用。为此提出 AR - Bench 基准评估大模型主动推理能力,实验显示大模型主动推理能力严重不足,并指出后续拓展方向。

机器之心
新闻资讯8

重磅!OpenAI深夜发布ChatGPT Agent:AI打工人正式上线「附发布会全程视频」

OpenAI推出ChatGPT Agent,它整合Operator远程浏览器和Deep Research能力,Pro、Plus和Team用户可激活。能完成复杂任务,有强大工具集,性能在多基准测试超人类,但OpenAI因能力增强启动最高安全保障。

AI寒武纪
算法论文8

LeCun团队揭示LLM语义压缩本质:极致统计压缩牺牲细节

图灵奖得主LeCun团队提出全新信息论框架,对比人类与LLM语义压缩策略。通过构建人类概念分类基准、选30+LLMs,发现LLM虽有语义组织能力,但难处理细粒度差异,侧重统计压缩,人类更重细节语境。

量子位
算法论文8

谢赛宁团队新作:不用提示词精准实现3D画面控制

谢赛宁团队新发布的Blender Fusion框架,结合图形工具 (Blender) 与扩散模型,让视觉合成不再仅依赖文本提示,实现精准画面控制。其核心是对现有技术高效组合,还透露两项训练技巧提升泛化性。

量子位
算法论文8

ICML 2025 Oral工作再升级!上海AI Lab联合复旦、港中文推出支持更长视频理解的最佳工具VideoRoPE++

上海AI Lab联合复旦、港中文推出支持更长视频理解的工具VideoRoPE++。它确定了将RoPE应用于视频的关键特性,构建评测基准V - RULER,提出外推方案YaRN - V,在多任务中优于先前RoPE变体。

机器之心
开源动态8

哈工大发布动画多智能体,文本一键生成连贯动画

随着多模态模型兴起,AI生成叙事性视频成热点,但现有方法处理长视频有挑战。哈工大发布AniMaker框架,由多个智能体协作,实现文本到动画自动化转换,解决了视觉连贯和叙事一致等问题。

AIGC开放社区