「视觉几何基准」共找到 1507 篇相关文章
无预训练模型拿下ARC-AGI榜三!Mamba作者用压缩原理挑战Scaling Law
CompressARC研究中,Mamba作者Albert Gu团队给出不同于大规模预训练的智能配方——最小描述长度(MDL)。一个76K参数、无预训练模型,在ARC - AGI - 1基准解决20%问题,获ARC Prize 2025第三名。
The Batch: 864 | GLM-4.5:一款开放的智能体竞争者
大型语言模型推动智能体能力交互竞赛正酣,中国 Z.ai 推出 GLM - 4.5 系列开源权重模型,在推理、编程等基准测试中表现出色,还介绍了其工作原理、研究和测试结果等。
如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26
AI视频生成技术发展迅速,现有检测方法难满足需求。最新综述提出「事实保真度验证」目标,梳理出视觉与语言双视角的四层检测框架,还分析了检测方法演进、评测指标和数据集,为AI视频检测提供落地地图。
ICLR 2026 Oral|大模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升
以DeepSeek - R1等为代表的大型推理模型存在过度思考问题,造成大量冗余计算。复旦大学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试中实现推理长度减半且性能提升。
AI破解500年《纽伦堡编年史》天书!仅用1小时,隐藏惊天真相被揭开
500年前《纽伦堡编年史》中的手写注释难倒人类学者,Gemini 3.0 Pro仅用1小时就给出解读,识别出注释与圣经年代学体系计算有关。它攻克视觉识别、解读缩写、还原历法转换表三大难题,展现惊人能力。
DeepSeek重磅开源3B OCR模型,一天处理20万页文档!一天内斩获6K标星!
DeepSeek开源3B OCR模型DeepSeek - OCR,参数量仅30亿,单张A100 - 40G一天能处理20万页文档,不到24小时获6K标星。它是视觉压缩引擎,解决大模型处理长文本算力爆炸问题,有诸多技术亮点。
The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者
Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 语言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。
Kimi K2 详测|超强代码和Agent 能力!内附Claude Code邪修教程
作者熬夜带来 Kimi K2 模型详测及 CC+K2 邪修教程。K2 是 1T 参数量的 MoE 开源模型,基准测试成绩优异,在代码、Agent、数学推理任务表现突出,前端能力强,还能驱动 Claude Code,成本低。
MiniCPM 4.0极速狂飙,端侧模型的比赛,结束了!
面壁智能联合清华发布MiniCPM 4.0,极限场景220倍加速。它是首个原生稀疏模型,有InfLLM v2、CPM.cu等创新,基准测试碾压对手,适配全平台,还有科研、工具调用等功能,标志端侧长文本时代到来。
打破56年数学铁律!谷歌AlphaEvolve自我进化实现算法效率狂飙,堪比AlphaGo“神之一手”
谷歌DeepMind联合顶尖科学家打造「通用科学人工智能」AlphaEvolve,打破矩阵乘法领域56年效率基准,将4x4矩阵乘法标量乘法次数从49次降至48次,还在谷歌内部加速了运算、缩短训练时间。文中介绍其原理与技术。