类脑视觉技术」共找到 3369 篇相关文章

算法论文8

突破视觉-语言-动作模型的瓶颈:QDepth-VLA让机器人拥有更精准的3D空间感知

视觉 - 语言 - 动作模型(VLA)在机器人操控领域潜力大,但应对长时序或精细操作任务时性能下降,根源是缺乏三维空间感知与推理能力。中国科学院自动化研究所与灵宝 CASBOT 提出 QDepth - VLA 模型,提升了机器人空间推理与操控精度。

机器之心
新闻资讯7

半年销量2000万+,宇凡微如何让AI模块“飞入寻常百姓家”?

芯师爷专访宇凡微品牌部总监张雨,探讨AI模块商业化前景。宇凡微展出多款AI模块,接入豆包大模型,有自研SAS系统等优势。其通过技术、市场等层面建护城河,践行“技术平权,快速量产”理念,未来向全场景方案升级。

芯师爷
开源动态8

中科院联合清华等发布视觉语言行动推理模型VLA-R1,让机器人先思考再行动

中科院自动化所、清华和GigaAI联合发布视觉 - 语言 - 行动模型VLA - R1,让机器人先思考再行动。它通过构建数据集教模型思维链,结合监督微调与强化学习提升性能,经多场景测试表现出色。

AIGC开放社区
新闻资讯7

众安信科参与打造宠物数字身份证 重磅亮相2025外滩大会 | 甲子光年

2025外滩大会上,众安保险与众安信科联合推出“NFT宠物数字身份证”外滩大会限定款,将RWA代币化技术与宠物健康管理结合。众安信科深度融合RWA与AI技术,打通宠物服务全链路,构建新生态。

甲子光年
算法论文8

GRPO训练不再「自嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化

GRPO在视觉生成流模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务中表现良好。

机器之心
算法论文8

腾讯混元TurboS技术报告首次全公开:560B参数混合Mamba架构,自适应长短链融合

腾讯公开混元TurboS技术报告,该模型是超大型Hybrid Transformer - Mamba架构MoE模型,融合Mamba与Transformer架构优势,有自适应长短思维链机制,激活参数56B。在多评测中表现佳,推理成本低。

AI前线
8

大模型思维链推理速度倍增!——RoT新框架把思维链「画」进隐空间

随着大模型规模扩展,思维链(CoT)成处理复杂推理任务标准范式,但显式CoT依赖长序列生成,隐式CoT面临优化挑战。腾讯提出RoT新框架,利用视觉编码器将文本推理步骤转为视觉嵌入,实现Token压缩与推理加速,且过程可分析。

腾讯技术工程
算法论文8

腾讯混元 TurboS 技术报告首次全公开:560B 参数混合 Mamba 架构,自适应长短链融合

日前腾讯混元 TurboS 技术报告全公开。它是超大型 Hybrid Transformer - Mamba 架构 MoE 模型,有自适应长短思维链机制,总参 560B。在多榜单成绩亮眼,多语种和多任务处理能力强,还介绍了核心创新、训练策略等。

InfoQ
算法论文8

斯坦福与Adobe新研究,模仿蒸馏技术轻松让200亿参数图像生成高质量大模型

斯坦福大学和Adobe研究院联手,用pi - Flow技术让200亿参数文本到图像大模型4步内生成高质量、高多样性图片。此前少步生成有质量和多样性问题,他们推出GMFlow和pi - Flow解决难题,LakonLab是其背后工程支撑。

AIGC开放社区
新闻资讯7

多模态爆发之后,谈 AI、IP 与漫剧

文章围绕AI漫剧展开,讲述其兴起动因,如技术突破、成本降低等;探讨IP创作该选成熟IP还是新IP;展望未来,认为它可能成主流,但要解决内容和技术难题;还提及工具平台与内容收益问题。

特工宇宙