「通用视觉感知系统」共找到 1584 篇相关文章
10万引普林斯顿刘壮最新访谈:架构没那么重要,数据才是王道
普林斯顿大学助理教授刘壮在访谈中指出,架构没那么重要,数据、规模和记忆才是决定AI成败的关键。他认为ConvNet和Transformer性能差异源于训练细节;当前数据集远不够多样;大语言模型有语言空间的世界模型,但视觉空间的还缺失;记忆是瓶颈,智能体只是权宜之计;AI目前还替代不了研究生。
首创像素空间推理,7B模型领先GPT-4o,让VLM能像人类一样「眼脑并用」
当前主流视觉语言模型(VLM)依赖文本token间接翻译视觉信息,缺乏直接视觉操作能力。滑铁卢大学等团队提出「像素空间推理」范式,让VLM能像人类一样「眼脑并用」,在四大视觉推理基准测试中,7B的Pixel - Reasoner表现碾压GPT - 4o等。
LeCun赌上后半生,押注大模型必死!Hassabis誓将Scaling进行到底
近日,「图灵奖」得主Yann LeCun炮轰硅谷主流AI路线,认为通过大模型实现AGI完全是「胡扯」。DeepMind创始人Demis Hassabis则反驳,认为LeCun混淆概念。二者的争论折射出AI未来五到十年的方向抉择。
RoboScience机器科学发布轮式仿人形机器人REX G1,打造新一代具身生产力伙伴
8月17日,RoboScience机器科学发布轮式仿人形通用操作机器人REX G1。它搭载自研VLOA架构通用具身大模型Visics,面向多场景,能在真实世界完成任务闭环,具备多方面优势。
技术狂飙下的 AI Assistant,离真正的 Jarvis 还有几层窗户纸?
随着AI技术进入新阶段,LLM面临新天花板,市场呼唤从「会聊天」迈向「能行动」的下一代AI Assistant。文章从智能规划与调用等维度分析其发展挑战,介绍不同技术路径并分析优劣势。
触觉具身来了个梦之队:天使轮近亿
5月27日,上海新智具身智能科技有限公司宣布完成近亿元天使轮融资。该公司源自复旦大学,核心团队实力强。它聚焦触觉具身智能,构建技术闭环,在数据采集、模型训练等方面有进展,已在工厂落地POC验证订单。
谷歌开源基于物理模拟的气象模型,能预测暴雨、台风、大干旱
传统通用循环模型处理小尺度有局限,谷歌开源基于物理模拟的神经通用环流气象模型NeuralGCM,在预测突发恶劣天气出色,还介绍其动态核心、物理模拟模块等,经测试有一定优势。
看完最新国产AI写的公众号文章,我慌了!
AI 快砸作者饭碗,智谱 GLM - 4.6V 能根据 NeurIPS 2025 最佳论文生成图文并茂的公众号文章。它还能助力学生看论文、分析财报等,可复刻网站、处理视频,在多模态评测中达同级别 SOTA。
全球1100万台出货,追觅打造最聪明的扫地机
追觅扫地机将AI打造成完整链路,实现从感知到决策的闭环。其X60 Pro采用超广角双目灵动导航避障技术,提升感知能力,引入强化学习优化决策,全球出货超1100万台,营收增长显著。
模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作
北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。