视觉思维链推理」共找到 2704 篇相关文章

开源动态8

去掉 VAE 之后,商汤用 8B 参数重新定义了开源生图的上限

商汤SenseNova U1开源后引发开发者社区关注,它基于NEO - unify架构,摒弃VAE,实现多模态理解与生成原生统一。在多项基准测试中表现出色,还针对企业办公场景优化,成为生产级任务新选择。

AI科技评论
算法论文8

公里级场景也能稳住了,国产团队把长视频3D重建又往前推了一步

浙江大学、地平线机器人和之江实验室的新工作 Scal3R 要解决长视频 3D 重建问题。它借助 test - time training 技术,设计全局上下文模块和同步机制,提升长序列重建稳定性和精度,能处理超万帧几千米的场景。

机器之心
产品应用7

京东广告大模型实战:GRAM 架构如何在 50ms 内完成生成式推荐?

流量红利见顶,广告营销转型遇挑战。京东张泽华在大会公开应对方案,介绍 GRAM 架构,实现意图与商品语义对齐,控制推理时延,解决冷启动等问题,还分享算法与知识工程实践。

InfoQ
开源动态8

RF-DETR-首个突破60 AP的实时检测器(附实战教程)

RF-DETR在COCO数据集上,实时检测精度首破60 mAP,兼顾实时性与高精度。它通过NAS找到Transformer实时运行的‘最优解’,迭代快,适用于多场景,还给出完整实战教程。

机器学习AI算法工程
新闻资讯8

“为了一个功能,需要再造一个Google!”Jeff Dean最新对话:TPU的诞生,与那些差点把服务器烧了的疯狂往事

在Google Cloud Next上,Jeff Dean和Amin Vahdat分享了Google算力帝国崛起秘史。从TPU诞生背景,到自研硬件血泪史,再到软硬件协同设计,还探讨了AI未来瓶颈,如能源、硬件等,以及代码编写现状。

AI科技大本营
算法论文7

近期,不错的LLM Agent统一记忆框架综述~

随着GPT、Qwen、Claude等大模型能力提升,LLM-based Agent走向长期任务。论文提出统一框架拆解Agent Memory为四组件,围绕两个数据集复现比较10个方法,还设计出新的低token开销框架。

PaperAgent
开源动态8

The Batch: 943|液体和气体如何运动

传统数值方法模拟复杂物理系统慢且贵,基于机器学习的模拟通常只适用于特定系统。研究人员构建通用 transformer 模型 Walrus,可模拟流体运动,开源且在多方面表现出色,有望加速多领域模拟工作。

DeeplearningAI
算法论文8

迎接范式革命:最新、最全的大模型Latent Space综述,NUS、复旦、清华等联合出品

大模型核心计算正从显式空间转向潜在空间,现有文献缺乏统一视角。NUS、复旦等机构的综述《The Latent Space》从五大视角构建框架,阐述潜在空间基础、演进、机制、能力,指出挑战与未来方向。

机器之心
算法论文8

Meta 重磅提出「神经计算机」:模型即电脑

Meta AI和KAUST提出「神经计算机」概念,目标是让神经网络承担计算、内存、输入输出。论文给出完整框架并做原型验证,虽当前原型距目标差距大,但提出问题和定义框架意义重大。

AGI Hunt
产品应用7

李飞飞World Labs双模齐发,能「造」超复杂大场景,一手实测

李飞飞的 World Labs 推出 Marble 1.1 和 Marble 1.1-Plus 两款模型。Marble 1.1 提升视觉效果,Marble 1.1-Plus 能生成更大更复杂场景。官方建议初用选 Marble 1.1,创建大场景用 1.1-Plus,还给出了实测和网友案例。

机器之心