「空间感知模型」共找到 8012 篇相关文章
132万字实时字幕!阿里语音模型支持影视飓风100小时直播
阿里升级实时语音识别大模型Fun-ASR-Realtime,首字延迟在百毫秒级别、识别准确率接近离线模型。在影视飓风100小时直播中表现出色,还支持16种方言和30种语言,离线模型Fun-ASR-Flash全球权威榜单排第一。
GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”
多模态大模型在高分辨率、元素密集的 GUI 场景易误判。苏州大学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。
智元机器人发布并开源首个机器人动作序列驱动的世界模型
智元机器人发布并开源全球首个基于机器人动作序列驱动的具身世界模型 EVAC 及具身世界模型评测基准 EWMBench,构建全新开发范式,解决具身智能演进制约,提升策略模型筛选与训练效率。
对话RoboScience邵林:VLOA大模型如何突破具身智能泛化瓶颈
本文对话RoboScience联合创始人邵林,探讨VLOA大模型突破具身智能泛化瓶颈。他介绍了模型优势、设计思路,对比VLA,还谈及范式、难点及落地场景等,强调以人中心、做有温度技术,重视模型落地。
谷歌前CEO施密特:中美大模型之间存在一个显著区别
7月26日世界人工智能大会上,谷歌前CEO埃里克·施密特与沈向洋对话,指出过去两年中国AI技术进步巨大。他认为中美领先AI模型有显著区别,中国部分模型开放权重,美国多数领先模型封闭。他期待中美合作应对AI变革。
深刻理解Token:大语言模型(LLM)是如何看待这世界?
文章指出在大语言模型(LLM)中,Token是处理文本的基本单位。介绍了Token的概念、分词方法、向量化过程,还阐述了分词对模型性能的影响,如导致模型在数学、多语言处理上表现不佳等。
多模态长文本理解测评首发:46款模型无一攻克128K难关
香港科大等研究者联合提出MMLongBench,用于评估多模态模型长文本理解能力。它覆盖5大类型任务的16个数据集,对46个模型测试显示,闭源和开源模型在长上下文任务均面临挑战,OCR和跨模态检索能力是瓶颈。
GPT-5刷屏吊胃口之际,英伟达发出暴论:小型语言模型才是未来
英伟达新论文指出,未来属于小型语言模型(SLM),挑战了智能体需用大型语言模型(LLM)的假设。SLM参数量低于100亿,有低延迟、低成本等优势,还给出从LLM到SLM迁移路线图。
807道灵魂拷问后,中国模型竟在「意义测试」中夺冠!
在美国新基准测试FAI - C中,中国开源模型Qwen3夺冠,DeepSeek的R1跻身前六,力压美国明星实验室顶级模型。该测试由前英特尔CEO帕特·基辛格所在公司Gloo推出,旨在让AI直面深层问题。
1M 参数干翻 200M!时序预测选模型,你可能一直都选错了
近期时序预测领域新模型频出,作者开源的 QuitoBench 显示,参数量仅 1M 的 CrossFormer 击败大模型夺冠。它还揭示模型选择与历史数据长度有关,且数据边际收益高于参数。