「扣子空间」共找到 525 篇相关文章
X上63万人围观的Traning-Free GRPO:把GRPO搬进上下文空间学习
年初 DeepSeek - R1带火大模型强化学习,GRPO成常见RL算法,但训练成本高。腾讯优图论文提出Training - Free GRPO,将GRPO训练范式迁移到上下文学习,成本低、泛化好,已开源。
从像素空间走向数据流形:生成模型的对抗净化新范式 | TPAMI'26
深度神经网络虽应用广泛,但对对抗样本脆弱,制约可靠部署。本文介绍发表于TPAMI 2026的工作,提出基于一致性模型的对抗净化方法(CMAP),实验表明其在不同场景下鲁棒性强,为对抗防御提供新视角。
V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间
近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文中提出视频表征自编码器 V-RAE。它以冻结的视觉基础模型为编码器压缩视频特征,还引入轻量级模块聚合信息。经实验验证,其在视频生成和预测上性能出色。
对话际数科技联创:质量赛道的先驱者,要做空间数据的「精炼厂」
本文是对际数科技三位联合创始人的访谈。在具身智能时代数据采集火热但数据荒严重背景下,际数关注数据质量,其以测绘背景为底气,用‘一张图、一把尺、一个飞轮’搭建技术护城河,打造质量因子库,还创新训练质量模型,有稳定商业路径。
大模型思维链推理速度倍增!——RoT新框架把思维链「画」进隐空间
随着大模型规模扩展,思维链(CoT)成处理复杂推理任务标准范式,但显式CoT依赖长序列生成,隐式CoT面临优化挑战。腾讯提出RoT新框架,利用视觉编码器将文本推理步骤转为视觉嵌入,实现Token压缩与推理加速,且过程可分析。
迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合的巨大待探索空间
大模型常采用RAG技术,多模态崛起使RAG向MM - RAG发展。目前MM - RAG研究初级,华中科技大学等研究者发布综述,覆盖所有模态组合,剖析工作流,提供构建系统的一站式指南。
破解空间智能数据稀缺难题,影石开源DiT架构全景生成模型,在线可玩
影石研究院团队推出基于DiT架构的全景图像生成模型DiT360,设计分层混合训练框架,结合透视与全景图像数据,提升真实感和几何一致性。它支持多任务,优于现有方法,为三维场景生成提供新思路。
具身VLA后训练:TeleAI提出潜空间引导的VLA跨本体泛化方法
现有VLA基座模型能力不足,跨本体适配存在挑战。中国电信人工智能研究院具身智能团队提出“对齐 - 引导 - 泛化”(ATE)框架,实现从调架构到调分布的范式转移,适配主流VLA模型,减少数据需求。
Dify、n8n、扣子、Fastgpt、Ragflow到底该怎么选?超详细指南来了。
文章从实用角度出发,对Dify、Coze、n8n、FastGPT和RAGFlow五款主流平台进行详细功能对比,结合真实使用体验和应用场景,为不同需求者提供选择指南,还给出选型考量要素。
西湖大学张驰团队:从视觉合成到空间理解,视频 AI 正在「转向」丨CVPR 2026
过去两年视频生成发展近成熟,但多数模型缺乏空间结构稳定建模能力。西湖大学AGI Lab团队提出论文,将问题落回推理阶段,让相机轨迹成约束条件,推进视频生成到三维结构约束建模。