数据持久化」共找到 3139 篇相关文章

算法论文8

超越人类标注,Meta提出CoT-Self-Instruct:如何用"推理式自进"重塑LLM训练

大语言模型发展需海量高质量训练数据,传统人工标注困境重重,现有合成数据方法也有缺陷。Meta提出CoT - Self - Instruct,通过推理式自进生成数据,实验证明其在多个任务上超越人类标注数据

深度学习自然语言处理
算法论文8

一文读懂深度表格数据表示学习 | 南京大学

南京大学团队系统介绍表格表示学习领域,将现有方法按泛能力分三类,比较DNN与树模型优劣,剖析核心挑战,探讨扩展方向及数据集评估策略,旨在建跨数据集稳健评估体系。

量子位
推荐文章7

AI Agent 的工程被低估了

文章指出 AI 发展中工程作用被低估,将其分为产品工程和技术工程拆解构建 AI Agent 体系。产品工程涵盖需求建模、UI/UX 设计等模块;技术工程涉及架构模块、流量控制等方面,还提及 Spring AI Alibaba 等工具。

阿里云开发者
开源动态7

AI 成为主流负载后,数据基础设施将如何演进?

随着AI应用爆发式增长,数据系统成为智能系统一部分。Apache Doris社区提出2026年主题‘Scale Intelligence, Accelerate Insight’,从场景和能力两方面阐述演进方向,以响应AI时代数据基础设施变

InfoQ
开源动态8

103K「硬核」题,让大模型突破数学推理瓶颈

现有大语言模型在数学推理训练时面临数据瓶颈,腾讯AI Lab与上海交大团队推出DeepMath - 103K数据集。它规模大、难度高、数据新颖、严格去污染,让DeepMath系列模型达SOTA,还能实现推理泛

机器之心
推荐文章8

“AI原生”觉醒:企业数智的弯道超车时刻|甲子光年

当下‘AI原生’成共识,但不少企业有数据难转、有工具难成闭环。文章提出‘数据×工具×组织’三重进框架,介绍数据智能趋势、火山引擎Data Agent等,还为企业拥抱Data+AI给出建议。

甲子光年
算法论文8

Nature子刊:攻克医疗器械「看不清」难题,赋予自动驾驶视觉

MicroSyn-X首创无需真实数据的AI合成影像技术,让机器在无标注虚拟X光中学会追踪微型手术器械,突破医疗数据稀缺瓶颈,为自动微创手术提供新路径,且代码和数据已开源。

新智元
推荐文章7

π0.6和GEN-1谁代表未来?乾坤未定,但这条底层赛道浮出水面

Generalist AI的GEN - 1引发行业关注,其创始人验证具身智能尺度定律。但很多公司在数据质量上遇困。智域基石提出‘数据编译’概念,构建五层编译管线,有独特商业模式,对未来数据路线持‘路线中立’观点。

机器之心
算法论文7

利用大模型检测钓鱼邮件:方法,效果及数据

随着企业安全防范增强,钓鱼邮件成重要攻击手段,大模型检测方法盛行。日本论文详细披露检测方法和实验数据,含解析解码、简邮件、生成prompt、调用LLM四步,还介绍数据集及评估了四个模型效果。

AI与安全
算法论文8

ICLR 2026 Oral | 西湖大学发布Real PDE Bench

复杂物理系统时空演预测是核心问题,当前AI模型多在数值仿真数据上训练,难以评估其在真实数据上的表现。西湖大学等实验室提出RealPDEBench,含真实与仿真数据,设三类任务、九个评估指标和十个基线方法。

力学与人工智能