「数据挑战」共找到 3343 篇相关文章
数据邪修大法好:仅用文本数据就能预训练多模态大模型
多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。
无法蒸馏的美国市场,谁在分食 Frontier Labs 百亿美金预算?
本文围绕美国数据市场展开,分析了数据赛道的投资判断、公司增长难题、需求结构、最新趋势等。指出数据虽重要,但外部数据公司份额难线性外推;真实世界数据成新热点,各细分领域格局和投资方向不同。
GraphQA:用自然语言对话分析图数据
图数据常见但分析门槛高,需懂算法和代码。NetworkX 算法多却复杂,普通用户难上手。GraphQA 搭建桥梁,用自然语言接口替代复杂 API,智能选算法,继承 NetworkX 优势还解决易用性问题。
The Batch: 869 | 编码助手的训练数据
研究人员开发自动生成编码助手训练数据的流程。斯坦福等高校及阿里团队提出 SWE - smith 方法,从 128 个 Python 仓库入手合成漏洞、验证并生成修复样本,成果免费开放,有望改进 AI 辅助编程模型。
DeepResearch的概念、核心挑战与进化路径
华为、利物浦大学等研究者撰写综述文章《DEEP RESEARCH AGENTS》,梳理了DeepResearch进展。它由大语言模型驱动,超越RAG等现有技术,介绍其核心技术组件,指出面临的挑战并指明未来发展方向。
偷数据的AI公司被抓到了
Reddit发现AI公司利用Wayback Machine开放性,绕过限制扒取大量历史数据用于模型训练。此前Reddit已对AI公司数据抓取设限,还起诉过违规公司。Reddit抵制该行为,宣布限制Wayback Machine索引其内容。
AI数据工程师在应用中如何"返璞归真"
文章反思‘知识库+Prompt工程+工具调用’轻量级Agent构建模式局限,指出其难应对知识质量、语义理解与规模化维护挑战。提出从‘Prompt驱动’到‘上下文工程’、从‘搭积木组装’到‘全链路闭环’的范式跃迁,并介绍MktAI知识体系建设。
从数据分布视角,重新认识下CoT
本文从数据分布视角重新审视大语言模型的思维链(CoT)推理。指出CoT并非真正推理,而是模仿,其效果受训练与测试分布差异影响。通过实验揭示CoT在分布偏移时性能退化,提醒勿过度依赖。
72小时AI生存挑战,发生了什么?
五源发起72小时AI生存挑战,7位不同背景参与者在封闭空间,仅用AI工具和100元资金生存并创造。有人训练AI朋友,有人创作作品。过程中暴露诸多问题,也让大家看到AI能力边界与未来可能。
OpenAI将发布AI Agent浏览器,挑战谷歌Chrome
路透社消息,OpenAI将在未来几周发布AI Agent驱动的网络浏览器,或挑战谷歌Chrome。其设计让部分交互在聊天界面完成,还能整合产品自动执行任务,不过也面临激烈竞争。