视觉几何基准」共找到 1507 篇相关文章

新闻资讯8

来自MIT最强AI实验室:OpenAI天才华人研究员博士毕业了!

OpenAI华人研究科学家陈博远完成MIT博士论文答辩。他不到4年读完博士,辅修哲学,是GPT图像生成核心成员和Sora视频团队成员,将推进世界模型技术,强调视觉世界模型对具身智能至关重要。

新智元
算法论文7

“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%

文章聚焦多模态长文档视觉问答,介绍现有LVLM - based和RAG - based技术路线及困境。提出MMRAG - DocQA方案,引入‘分层索引 + 多粒度检索’,设计双索引建模相关性与依赖,用互补策略实现证据互补。

CourseAI
开源动态8

外卖公司也能搞AI?

昨天凌晨美团悄悄开源560B参数的MoE大模型LongCat-Flash-Chat,引发国外网友疑惑。该模型推理速度超100 tokens/秒,基准测试表现出色,多项设计解决实际问题,贴合美团业务需求。

AGI Hunt
算法论文8

大模型破译甲骨文创下新SOTA!复旦团队推出新框架

复旦大学团队提出基于部首和象形分析的可解释甲骨文破译框架,构建PD - OBS数据集。该框架在公开基准数据集上准确率高,零样本破译能力强,还能为未破译甲骨文输出可解释分析文本,助力考古工作。

量子位
算法论文8

追剧不断网,可能背后有个AI在加班,故障诊断准度破91.79%

中兴通讯和中国移动团队针对电信网络故障诊断难题,提出 TN - RCA530 基准和 Auto - RCA 框架。测试多个大模型,初始准确率低,经框架优化后,Gemini - 2.5 - Pro 准确率从 58.99% 升至 91.79%,超人工水平。

机器之心
算法论文8

免剪辑直出!AI生成多角色同框对话视频,动态路由精准绑定音频

Bind-Your-Avatar基于扩散Transformer框架,通过细粒度嵌入路由将语音与角色绑定,实现精准音画同步,还引入数据集MTCC和基准测试,实验显示其在身份保真和音画同步上优于现有方法。

新智元
产品应用8

证明也有「选择困难症」?腾讯AI Lab与大模型研究部联手打造 MPS-Prover ,多视角破解形式化推理瓶颈!

本文聚焦逐步式自动化定理证明器困境,腾讯AI Lab等提出MPS - Prover。它有数据筛选和多视角树搜索两项创新,提升搜索效率和证明质量,在多基准表现佳,还解决六道IMO难题。

AI科技评论
开源动态8

GLM-5.2 正式发布:开源之王来了,摸到了Opus-4.8

GLM-5.2正式发布,主打长程任务能力,有1M token上下文窗口且完全开源。它在长程任务基准评测中表现出色,与顶级闭源模型差距缩小,还解决了超长上下文计算成本问题,同时应对了模型‘作弊’情况。

AI寒武纪
开源动态8

空间智能新作,影石开源户外全景重建算法

近日,Insta360 研究院联合高校提出 PanoLOG,首个面向全景输入的大规模户外三维重建工作。它解决全景分区难题,在多基准上取得领先渲染质量与小模型体积,还为户外具身智能等提供新思路。

机器之心
算法论文8

ICML 2026 | 北大提出的APEIRIA,打破了3D MLLM黑盒推理困境

北大团队提出面向3D空间推理的新框架APEIRIA,将神经符号程序推理模式蒸馏进3D MLLM。采用三阶段课程学习,在多基准测试表现强劲,保留模块化优势,为具身智能系统提供启发。

机器之心