「数据驱动」共找到 2939 篇相关文章
数据邪修大法好:仅用文本数据就能预训练多模态大模型
多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。
规范驱动开发:瀑布模型回潮
规范驱动开发(SDD)重拾编码前写大量文档理念,虽为AI编程提供框架,但可能让敏捷性被Markdown文档掩埋。文章探讨为何迭代性自然语言方法更契合现代开发需求,指出SDD存在诸多不足。
无法蒸馏的美国市场,谁在分食 Frontier Labs 百亿美金预算?
本文围绕美国数据市场展开,分析了数据赛道的投资判断、公司增长难题、需求结构、最新趋势等。指出数据虽重要,但外部数据公司份额难线性外推;真实世界数据成新热点,各细分领域格局和投资方向不同。
GraphQA:用自然语言对话分析图数据
图数据常见但分析门槛高,需懂算法和代码。NetworkX 算法多却复杂,普通用户难上手。GraphQA 搭建桥梁,用自然语言接口替代复杂 API,智能选算法,继承 NetworkX 优势还解决易用性问题。
The Batch: 869 | 编码助手的训练数据
研究人员开发自动生成编码助手训练数据的流程。斯坦福等高校及阿里团队提出 SWE - smith 方法,从 128 个 Python 仓库入手合成漏洞、验证并生成修复样本,成果免费开放,有望改进 AI 辅助编程模型。
AI 驱动的多代理金融工作台
Vibe-Trading 是 AI 驱动的多代理金融工作台,能将自然语言请求转化为交易策略等。它有自然语言转策略、多数据源、专家团队等核心能力,具备面向交易的深度研究等功能,还介绍了安装方式、环境变量和推荐模型。
规范驱动开发:让架构变得可执行
文章介绍规范驱动开发(SDD),它是软件架构重大转变,以可执行规范为核心,构建五层执行模型,反转传统架构关系,强调漂移检测,明确人机分工,具备五项核心能力,但采用时也面临多种权衡。
偷数据的AI公司被抓到了
Reddit发现AI公司利用Wayback Machine开放性,绕过限制扒取大量历史数据用于模型训练。此前Reddit已对AI公司数据抓取设限,还起诉过违规公司。Reddit抵制该行为,宣布限制Wayback Machine索引其内容。
综述:LLM 驱动AI Agent通信协议与策略
文章指出传统互联网用户完成行程繁琐,而代理互联网可让代理自动完成。随着LLM驱动智能体应用深入,其发展专业化,需多智能体协同,有效通信成关键。介绍了智能体通信定义、分类及多种通信协议。
AI数据工程师在应用中如何"返璞归真"
文章反思‘知识库+Prompt工程+工具调用’轻量级Agent构建模式局限,指出其难应对知识质量、语义理解与规模化维护挑战。提出从‘Prompt驱动’到‘上下文工程’、从‘搭积木组装’到‘全链路闭环’的范式跃迁,并介绍MktAI知识体系建设。