数据存储」共找到 2618 篇相关文章

算法论文8

打破「数据暴力」预训练惯性,阿里Qwen、上交大等提出预训练动态数据选择范式OPUS

阿里Qwen、上交大等团队提出预训练动态数据选择范式OPUS,打破“数据暴力”预训练惯性。它将数据选择与优化器更新轨迹对齐,提升预训练效率与下游泛化表现,实验显示其“效率+性能”双提升。

机器之心
新闻资讯7

甲骨文副总裁吴承杨:AI 放大了数据优势,数据融合至关重要

甲骨文公司副总裁吴承杨称AI放大其数据优势,多模融合数据库至关重要。中国区技术咨询部高级总监嵇小峰表示企业构建Agent AI要关注数据访问需求和安全。Oracle用一体化架构解决融合问题,还介绍了相关技术及应用。

AI前线
算法论文8

训练数据枯竭怎么办?首篇「数据价值密度」综述理清思路

上海交通大学与上海人工智能实验室团队发布首篇「数据价值密度」综述。提出“数据价值密度”概念并定义,建立分类框架梳理现有工作,还指出该领域面临的挑战,为大模型训练提供指南。

机器之心
算法论文8

LLM的下一战:从狂卷数据到精算数据

大模型竞争核心正从比拼数据规模转向数据使用效率和风险管理。文章分享2025两篇论文,介绍高效训练和机器遗忘两赛道,前者有数据价值飞轮5大模块,后者提出三时段分类法、三层次遗忘及评价指标全景。

PaperAgent
算法论文8

图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果

百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。

量子位
推荐文章8

万亿AI存储鸿沟如何填平?

文章指出AI存储迎来爆发期,新一代分布式存储成主流。分析存力需求变化、传统存储架构问题,介绍Universal Storage架构优势,还提及对标Vast Data的公司画像,认为新一代存储软件赛道值得关注。

芯师爷
算法论文8

TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的

该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。

深度学习自然语言处理
产品应用8

具身智能的无本体数据,终于有了自己的「代表作」

自变量机器人发布的Demo中,机器人用数百条无本体数据完成化学实验。其发布的TwinDEX系统由无本体数据采集系统和机器人末端执行器组成,能让无本体数据获接近真机数据的训练效果,重新定义数据采集逻辑。

AI科技评论
新闻资讯7

数据困局下的具身智能,谁能率先破局?

具身智能面临数据困局,Skild AI 关注真实数据不足难题。学者 Levine 称只有真实数据能达通用具身智能,而王鹤认为合成数据可助具身智能冷启动和规模化发展。遥操作和 Sim2Real 是不同技术路线。

机器之心
产品应用8

为何底层数据湖决定了 AI Agent 的上限?

随着 AI 落地企业进程加快,数据类型更丰富,传统企业级数据架构面临瓶颈。火山引擎构建多模态数据湖,以 Lance 为湖格式,从多维度选型技术,解决存储等问题,在多行业有应用潜力。

InfoQ