「视觉识别」共找到 866 篇相关文章
超越Runway!Adobe发布新神器:P视频比P图还简单
Adobe联合多高校推出AI模型EditVerse,它将图片和视频编辑整合,解决传统视频编辑复杂、数据稀缺问题。通过通用视觉语言、上下文学习能力和知识迁移,其效果超Runway,还展现涌现能力。
VLA统一架构新突破:自回归世界模型引领具身智能
北京智源研究院联合中科院自动化所提出 UniVLA 全新 VLA 模型架构,基于全离散、自回归机制建模多模态信号,后训练引入世界模型。它刷新多项基准纪录,在真机操控和自动驾驶有潜力,为多模态感知决策融合带来新思路。
统一架构新思考,北大团队UniWorld-V1统一大模型
北大袁粒课题组提出统一大模型架构UniWorld-V1。通过对GPT - 4o - Image实验,发现其依赖语义编码器提取视觉特征,据此设计架构,在多基准测试表现优异,开源代码等促进研究。
告别通用具身模型崇拜:具身智能走向异构策略编排
当VLA、WAM等机器人控制策略在各自任务中表现出色,如何为子任务匹配合适策略成完成复杂长时序任务关键。RoboHarness解决异构策略协同难题,通过协同调用策略提升成功率。
李飞飞第一篇「触觉」论文:机器人会盲摸麻将了
李飞飞等全明星阵容关注灵巧手研究,提出T-Rex模型。其通过给触觉单独开通路等方式解决触觉加入难题,在真实任务中表现出色,还为灵巧手领域带来从机身分化、启发专用场景应用等变化。
The Batch: 942|暗基因组揭秘
AlphaGenome 能解读人类和小鼠基因组中 98% 不编码蛋白质部分,识别多项特征。它经预训练和知识蒸馏,在多项评测超早期模型,API 等免费用于非商业,助研究基因组与生物过程联系。
击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军
在具身灵巧操作奥林匹克赛事Benjie’s Olympics中,中国具身智能公司星动纪元斩获三项全球第一,超越美国明星公司PI。其自研VLA具身模型优势显著,且已在多领域落地应用。
马斯克官宣1万亿瓦芯片计划,红杉合伙人力挺:xAI会赢!
马斯克宣布自建晶圆厂“Terafab”,目标每年1太瓦算力,还要把数据中心送上天,引发争议。红杉合伙人Shaun Maguire力挺xAI,认为其会赢,还指出马斯克有识别技术拐点的能力,虽错过语言模型转向,但已修正。
极客大神构建了LLM架构画廊,AI大神Karpathy点赞
极客大神Sebastian Raschka构建LLM Architecture Gallery,将复杂模型结构化繁为简,引发技术圈讨论,AI大神Karpathy点赞。画廊高度视觉化、互动性强,展示模型架构图及核心参数,源数据开源。
TPAMI 2026 | 仅用两个变量破解混杂因素:CIC实现动力学因果推断与混杂变量重构
上海交通大学陈洛南团队与西北工业大学张绍武团队合作,在《IEEE Transactions on Pattern Analysis and Machine Intelligence》发表成果,提出动力学因果判别框架CIC,能在有未观测混杂变量时,借观测数据识别因果、重构变量与网络。