数据制备系统」共找到 3890 篇相关文章

算法论文8

香农、信息论、AI、Scaling Law,以及信息的观察者效应

文章围绕经典信息论在AI实践中的矛盾展开,介绍CMU和NYU论文《From Entropy to Epiplexity》提出的新概念,解释合成数据数据排序等问题,还探讨合成数据飞轮能否持续,指出epiplexity可定义数据质量。

花叔
开源动态8

首个Data Agent基准测试来了!2007个测试任务将数据库、PDF、视频、音频异构数据源一网打尽

南洋理工大学、新加坡国立大学与华为开源首个针对数据智能体异构混合数据分析的基准测试FDABench。它有2007个任务,覆盖多领域多数据源,独创协作框架,能测多种工作流模式的数据智能体。

量子位
推荐文章7

详细介绍!RAG 和 GraphRAG:了解何时(When)、如何(How)使用它们

文章详细介绍传统RAG和GraphRAG技术,前者通过向量搜索检索上下文,但无法体现数据关系;后者用知识图谱提升检索效果,亮点是构建图谱、整合信息。还指出两者优缺点,建议结合使用。

AINLPer
算法论文8

超越人类标注,Meta提出CoT-Self-Instruct:如何用"推理式自进化"重塑LLM训练

大语言模型发展需海量高质量训练数据,传统人工标注困境重重,现有合成数据方法也有缺陷。Meta提出CoT - Self - Instruct,通过推理式自进化生成数据,实验证明其在多个任务上超越人类标注数据

深度学习自然语言处理
算法论文7

表格建模也能Scaling?树模型的时代要改变了

文章指出 AI 算力增长与结构化数据建模以树模型为主形成反差。浙大 X 蚂蚁 AIforData 团队探索结构化数据预训练,在表格数据和行为序列预训练上有成果,验证了 Scaling Law,预示结构化数据建模范式将改变。

机器之心
推荐文章8

Databricks × Snowflake 纷纷下注,PostgreSQL 成 AI 时代数据库标准?

文章结合作者对数据基础设施的实践与反思,探讨生成式AI时代数据系统的挑战与机遇。介绍数据基础设施新趋势,分析Neon、Supabase等公司受关注原因,指出PostgreSQL成行业标准,还提出Data Warebase概念及优势和应用场景。

InfoQ
开源动态7

14k颗星!你的电脑屏幕,正在成为AGI的“眼睛”!这款开源神器让你一键记录所有操作

介绍开源项目ScreenPipe,它是跨平台桌面数据抓取API,能全维度记录数据,有沙盒化插件系统等功能。因能为AGI提供数据、对开发者友好而火,还给出安装和创建插件命令,称其有成为AGI时代“现实采集器”的野心。

GitHubStore
开源动态8

103K「硬核」题,让大模型突破数学推理瓶颈

现有大语言模型在数学推理训练时面临数据瓶颈,腾讯AI Lab与上海交大团队推出DeepMath - 103K数据集。它规模大、难度高、数据新颖、严格去污染,让DeepMath系列模型达SOTA,还能实现推理泛化。

机器之心
推荐文章8

“AI原生”觉醒:企业数智化的弯道超车时刻|甲子光年

当下‘AI原生’成共识,但不少企业有数据难转化、有工具难成闭环。文章提出‘数据×工具×组织’三重进化框架,介绍数据智能化趋势、火山引擎Data Agent等,还为企业拥抱Data+AI给出建议。

甲子光年
算法论文8

Nature子刊:攻克医疗器械「看不清」难题,赋予自动驾驶视觉

MicroSyn-X首创无需真实数据的AI合成影像技术,让机器在无标注虚拟X光中学会追踪微型手术器械,突破医疗数据稀缺瓶颈,为自动化微创手术提供新路径,且代码和数据已开源。

新智元