「跨视角视觉理解」共找到 1460 篇相关文章
AI真的能读懂人心吗?阿里通义最新研究成果揭示答案
文章聚焦多模态推理问题,如全局上下文理解不足和推理捷径问题。介绍阿里通义HumanOmniV2改进方案,涵盖全局上下文理解等方面,还详述冷启动、两阶段强化学习训练方案及数据集下载和训练方法。
模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作
北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。
智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析
智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。
一年从3B卷到0.xB:MonkeyOCRv2用0.7B拿下17语种文档解析开源第一
文档OCR正迈入小模型时代,MonkeyOCRv2以0.7B、0.6B参数在MDPBench上超越3B模型。它重新分配系统职责,采用互补预训练目标,还开源训练数据,且迁移到多任务表现良好。
一位工程师对“好代码”的 7 年思考
本文围绕“什么是好代码”展开,作者结合自身职业发展,从初入职场的“黑盒认知”到深入思考多维度评价标准。还介绍代码评审标准,从稳定、体验、效率、成本衡量。最后给出写好代码的方法和面临的挑战。
LeCun有了新证据!大模型思考与人类思考存在本质差别
Yann LeCun参与的研究用信息论揭示大语言模型与人类在‘理解世界’上的本质差异。研究引入新量化框架,分析主流大模型,发现AI与人类在‘理解’上有三大核心差异,对当前AI发展趋势提出挑战。
独家!哈工大斩获AI顶会ACL评审阶段最高分,让AI领略汉字之美
哈工大论文获AI顶会ACL 2025评审阶段已知最高分。团队用传感器捕捉手部书写实现汉字输入识别,独创中文字形编码让AI理解汉字形态,革新中文人机交互,推动汉字文化传承,为AI理解汉字开辟新路。
姚顺雨现场颁奖,吉嘉铭、董冠霆等15位青年人才获腾讯「青云奖学金」
腾讯「青云奖学金」在深圳颁奖,首期选出 15 位获奖者,每人获 20 万现金和价值 30 万云异构算力资源。姚顺雨现身颁奖,获奖者有白雨石、陈俊松等青年 AI 学者,各有出色研究成果。
世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍
视觉规划里世界模型‘想象’过程慢,西安交通大学研究团队提出Fast LeWorldModel,从根本改变预测方式,实验显示其提升了成功率,还大幅缩短规划时间。
多模态BUG修复新SOTA:慕尼黑工大GUIRepair登上SWE-bench Multimodal榜单第一
自动化修复软件缺陷是长期目标,多模态问题修复受关注。慕尼黑工业大学团队提出GUIRepair,融合APR与GUI Testing知识,登上SWE - bench Multimodal榜单第一,为多模态软件自动修复开辟新路。