「多源数据分析」共找到 3310 篇相关文章
先解行为,再训Agent:CMU开源首份Agentic Search日志数据,把Agent拆开给你看
CMU团队基于DeepResearchGym平台,从半年真实流量中整理出数据,构建并在Hugging Face开源首个Agentic Search行为日志数据集。还提出三层分析框架,刻画智能体搜索行为,为研究和系统设计提供基础与信号。
详解Github 35K+项目:打通200+数据源,构建企业级AI的数据统一入口,支持MCP【下篇】
本文继续介绍MindsDB这款开源AI数据引擎,阐述知识库与混合检索应用,如创建向量索引、语义检索、多源混合检索等;还提及RAG与数据智能体,包括构建RAG管道和配置Data Agent;最后给出应用建议,称其适合复杂企业环境。
甲骨文副总裁吴承杨:AI 放大了数据优势,数据融合至关重要
甲骨文公司副总裁吴承杨称AI放大其数据优势,多模融合数据库至关重要。中国区技术咨询部高级总监嵇小峰表示企业构建Agent AI要关注数据访问需求和安全。Oracle用一体化架构解决融合问题,还介绍了相关技术及应用。
训练数据枯竭怎么办?首篇「数据价值密度」综述理清思路
上海交通大学与上海人工智能实验室团队发布首篇「数据价值密度」综述。提出“数据价值密度”概念并定义,建立分类框架梳理现有工作,还指出该领域面临的挑战,为大模型训练提供指南。
LLM的下一战:从狂卷数据到精算数据
大模型竞争核心正从比拼数据规模转向数据使用效率和风险管理。文章分享2025两篇论文,介绍高效训练和机器遗忘两赛道,前者有数据价值飞轮5大模块,后者提出三时段分类法、三层次遗忘及评价指标全景。
Agent狂欢下的冷思考:为什么说Data&AI数据基础设施,才是AI时代Infra新范式
文章指出Agent成AI主流叙事,但企业部署后效果不佳,因未认识到Agent平台无法单独构成AI Infra。强调数据是AI Infra核心,提出Data&AI数据基础设施是新范式,还分析赛道玩家并介绍科杰科技的实践。
图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果
百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。
Vercel 推出 Drains 功能:实现统一数据导出
Vercel 发布 Drains 系统,将平台可观测性数据统一导出至外部服务,覆盖多来源日志等。用户可两种方式配置,导出数据与多系统兼容,能简化接入流程、减少管道碎片化。
AI分析师强得可怕
博主黄益贺称其AI分析师比多数人类分析师厉害。以分析ChatGPT Atlas为例,展示其深度思考、调研和分析能力。还介绍了用Claude Skills做的AI分析师能力包升级,提升了深度思考能力。
TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的
该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。