大涡模拟网络」共找到 5431 篇相关文章

推荐文章8

对话RoboScience邵林:VLOA模型如何突破具身智能泛化瓶颈

本文对话RoboScience联合创始人邵林,探讨VLOA模型突破具身智能泛化瓶颈。他介绍了模型优势、设计思路,对比VLA,还谈及范式、难点及落地场景等,强调以人中心、做有温度技术,重视模型落地。

甲子光年
算法论文8

一种基于滑动层合并的高效深度修剪模型的方法

文章指出深度修剪可加快推理速度,但直接丢层会降低性能。为此提出滑动层合并法,根据相似度阈值融合连续层,简化结构且保持性能。实验显示该方法优于现有技术,还揭示了与宽度修剪结合的潜力。

机器学习AI算法工程
开源动态7

DeepSeek R1 迎来小更新升级,性能直逼 OpenAI o3!

昨日,DeepSeek 发布 R1 模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。

AI科技大本营
算法论文8

世界首个!李飞飞团队推出物理推理基准,模型统统不及格?

斯坦福联合中科团队推出世界首个评估视觉语言模型物理推理能力的基准QuantiPhy,通过测试发现顶尖模型在数值计算上不如人类,还揭示模型推理靠记忆而非测量,为AI发展指明方向。

AIGC开放社区
产品应用8

Thinking Machines发布首个产品Tinker :模型后训练彻底变天

OpenAI前CTO Mira Murati的Thinking Machines公司发布首个产品Tinker,这是为微调模型设计的灵活API,能简化LLM后训练过程,让用户专注算法和数据,平台处理分布式训练。它有多种特性,已被顶尖机构采用。

AI寒武纪
推荐文章8

Kimi 模型训推混部的稳定性与资源优化实战

月之暗面系统工程师黄维啸在 QCon 会分享 Kimi 模型训推混部实践。介绍了训推集群挑战,如故障多、资源利用低等,还阐述了全链路稳定性提升、资源高效利用及强化学习混合部署等方案。

InfoQ
产品应用7

用最简单的模型技术打造一个迁云专家有多难?

文章探讨在云迁移领域用模型技术“复制”专家80%核心能力。分析标准化方案不足及简单RAG局限,介绍“LX0.1”AI专家助手构建,还提及分层评测、人机协同等优化,最后展望AI在云迁移的未来方向。

阿里云开发者
产品应用8

一场对话,我们细扒了下文心模型背后的技术

信通院模型推理能力评估中,文心X1 Turbo获最高级“4+级”。百度AI Day上,副总裁吴甜解析文心4.5 Turbo和文心X1 Turbo,从多模态、深度思考等方面介绍技术,还展示其在多场景应用成果。

量子位
算法论文7

模型刷数学题竟有害?CMU评估20+模型指出训练陷阱

CMU团队评估20多个模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。

量子位
开源动态8

Anthropic祭出模型“读脑”杀手锏:LLM决策过程全给你扒开看

Anthropic宣布开源电路追踪工具,可追踪LLM神经元,通过生成“归因图谱”揭示模型输出原因。开源了生成图谱的库和交互式前端,并提供demo notebook。可追踪电路、可视化图谱、检验假设。

AI寒武纪