「大模型数据」共找到 9982 篇相关文章
企业数字化转型新引擎:MCP + LLM + Agent 架构赋能!
本文介绍MCP(Model Context Protocol)模型上下文协议,它是Anthropic于2024年11月底推出的开放标准,可统一大模型与外部数据源和工具通信协议,打破数据孤岛,有诸多优势,还适用于多个场景。
大概念模型:AI 推理的新范式
大概念模型(LCM)是自然语言处理新范式,侧重结构化推理和理解,与 LLM 不同。它依赖结构化知识,可模拟专家思维,解决当前 AI 缺陷,文章还介绍其架构、应用、局限,探讨与 LLM 结合的未来发展。
英伟达揭示RL Scaling魔力!训练步数翻倍=推理能力质变,小模型突破推理极限
学界对强化学习能否让模型学会新推理技能争论已久,过去研究多悲观。英伟达研究指出,问题源于任务在基础模型训练数据中过度呈现及训练步数不足。其ProRL框架提升训练步数,释放小模型潜力,还构建技术组合拳。
DeepSeek-OCR降本增效,10×暴力压缩还能读得清
Deepseek - OCR模型发布,通过光学压缩技术解决长文本处理的计算效率问题,能控制大模型token消耗成本。介绍了其架构设计、数据引擎及训练流程,还展示其用较少token超越现有模型的能力。
当 AI 下场炒 A 股,「推理」成了新的直觉
海外“AI Trading Battle”实验中,不同大模型交易表现差异大。港科大等团队提出RETuning方法,基于A股数据集验证,显著提升大模型金融预测准确率、推理可解释性,是综合改进方案,但有算力等局限。
成本不到8千美元!新浪微博1.5B小模型超越近万亿参数模型
新浪微博开源的VibeThinker - 1.5B模型,仅15亿参数、训练成本不足8000美元,却在顶级数学竞赛基准击败近万亿参数模型。它采用频谱到信号原则,分两阶段训练,性能出色,成本低且数据无污染。
斯坦福年度结论:中美大模型已没差距
斯坦福HAI《2026年AI指数报告》指出,中美AI模型性能差距基本消除,AI能力加速发展且普及快,但也存在安全基准滞后等问题。报告含15个主要结论,已成为业界重要参考。
小米打通智驾和具身大模型,然后开源了
小米汽车陈龙团队开源全球首个跨具身基座模型MiMo - Embodied,基于MiMo - VL架构,采用四阶段训练策略,打破室内操作与户外驾驶领域鸿沟,在29个Benchmark上超现有模型。
数据智能体全景报告发布!你的数据智能体在哪个 Level?
大语言模型爆发让「数据智能体」应运而生,但概念笼统成发展绊脚石。由多顶尖机构组成的联合团队发布论文,首提 L0 - L5 六级自主性分级标准,还对现有研究回顾审视,指明挑战并描绘未来图景。
伯克利神作背刺OpenAI:持续学习才是真神!
伯克利等机构发布FST框架,通过快慢分层解决大模型持续学习死局。过去两年头部实验室都在提升模型推理能力,却忽视持续学习。FST让模型像大脑一样快慢分层,提升数据效率、减少遗忘,使持续学习可工程化。