大规模数据」共找到 6816 篇相关文章

新闻资讯8

2026具身智能数据赛道,卷出了一匹「黑马」

在具身智能面临数据掣肘的背景下,觅蜂科技宣布2026年4月16日将在上海举办一站式物理AI数据服务平台发布会,展示全栈方案,解决核心痛点,发布会有诸多看点,还将举办高规格圆桌论坛。

机器之心
新闻资讯7

数据困局下的具身智能,谁能率先破局?

具身智能面临数据困局,Skild AI 关注真实数据不足难题。学者 Levine 称只有真实数据能达通用具身智能,而王鹤认为合成数据可助具身智能冷启动和规模化发展。遥操作和 Sim2Real 是不同技术路线。

机器之心
开源动态7

从社区数据出发,再看模型开源开发生态全景与趋势

蚂蚁开源先后在527蚂蚁技术日和外滩会发布模型开发生态开源项目全景图1.0和2.0版本。2.0版更新评估方法,呈现生态新变化,还分析技术趋势、开发者分布,提及项目进出情况及TensorFlow衰落等。

InfoQ
算法论文7

数据分布视角,重新认识下CoT

本文从数据分布视角重新审视语言模型的思维链(CoT)推理。指出CoT并非真正推理,而是模仿,其效果受训练与测试分布差异影响。通过实验揭示CoT在分布偏移时性能退化,提醒勿过度依赖。

深度学习自然语言处理
产品应用8

融合风控知识的模型体系建设与应用实践

腾讯算法专家欧阳天雄在AICon会分享《模型驱动下的智能风控落地实践》,介绍腾讯天御融合海量风控知识构建金融风控模型,解决传统风控模型难题,还展示构建技术、工程实践及落地案例,为金融风控提供新思路。

InfoQ
新闻资讯8

一副手套,干翻硅谷炫技派!中国队杀入战场,狂卷100万小时数据

硅谷具身智能玩家为数据发愁,中国灵初智能另辟蹊径,用数据手套采集工人操作数据,成本低且数据泛化性强。其专注物流细分场景,2026年收敛资源做深现有场景,目标推100万小时数据训练模型。

新智元
推荐文章8

NVIDIA技术沙龙 《规模EP优化:PD分离MoE并行方式》课程笔记

本文是NVIDIA技术沙龙课程笔记,介绍规模EP优化的PD分离MoE并行方式。涵盖PD分离、规模专家并行等五项关键技术创新,还对比多模型架构,展示推理服务架构性能特点与优化策略,以及各技术工作流程和效果。

GiantPandaLLM
新闻资讯7

全国首部“高质量数据集验收”标准,现公开征集起草单位和专家!

国家数据局等明确支持数据流通服务机构与人工智能企业合作,凸显数据到模型训练与产业应用环节的重要性。现有数据质量标准在产业场景有缺口,全国首部《人工智能训练数据集交付与质量验收规范》团体标准应运而生,现征集起草单位和专家。

AI大模型应用实践
开源动态8

如何科学地“设计”SFT 数据?一次关于 ODA 的完整平台级验证

模型后训练阶段,SFT数据构建常依赖‘直觉’或‘试错’。上海人工智能实验室OpenDataLab团队发布报告,基于OpenDataArena提出新范式,将数据集构建从‘随机艺术’变为‘确定性工程’,并进行平台级验证。

深度学习自然语言处理
推荐文章7

当AI成为预言家:数据时代,我们正在失去理解世界的能力吗?

文章借神经科学家Grace Huckins观点,探讨AI时代人类理解世界能力问题。以‘微处理器论文’实验为例,指出数据未必带来理解。还阐述理解与预测分离、科学理解危机等,强调理解应是科学核心。

AIGC开放社区