大模型预训练」共找到 9479 篇相关文章

算法论文8

AMD新论文颠覆认知:FP4训练不稳定,原因不是随机性不足

模型训练成本高,降低训练精度可降成本。AMD联合宾州州立学论文颠覆认知,揭示FP4训练不稳定源于结构性微缩放误差,非随机性不足,还在原生FP4硬件完成大模型预训练

机器之心
开源动态8

字节跳动开源文档解析模型Dolphin,告别繁琐的文档处理,上线狂揽1k星,真是绝了!

字节跳动开源文档解析模型Dolphin,采用两阶段分析 - 解析范式,有异构锚点提示等功能,适用多领域。技术架构基于视觉 - 编码器 - 解码器,训练集超3000万个样本,安装推理简单,比同类更具竞争力。

小华同学ai
新闻资讯7

Redis 之父:哪怕被喷我也得说,AI 远远落后于人类程序员!开发者跟评:用模型气得我自己写代码都有劲儿了

Redis 之父 Antirez 分享研发经历,认为人类程序员比模型出色,人类能打破常规想出更有效解法。他在修复 Redis 复杂 bug 时,与 Gemini 2.5 PRO 交流,凸显人类创造力优势。开发者看法不一,AI 虽成工具但缺创造力。

AI前线
算法论文8

统一视觉多模态与多任务!快手可灵与港科团队发布视频生成模型,加速真实世界理解

港科、港中文、清华和快手可灵团队提出全新视觉框架UnityVideo,统一训练多种视觉模态,让模型更懂物理规律,视频生成更真实可控,还实现零样本泛化,在多任务表现优异。

量子位
开源动态8

卡帕西630行代码炸出81个智能体,4天协作跑2333次实验,公布预训练发现

Karpathy的Autoresearch项目630行代码让AI自主实验,提升语言模型训练效率。全球开发者让多智能体协作,智能体自发形成同行评审制度。项目发起者公布十发现,还衍生出表现出色的auto - discovery项目。

量子位
开源动态8

突破具身智能任务规划边界,刷新具身脑多榜单SOTA,中兴EmbodiedBrain模型让具身脑学会「复杂规划」

当前主流语言模型在具身任务场景面临瓶颈,中兴星云脑团队推出具身视觉 - 语言基础模型 EmbodiedBrain,构建全流程创新框架,在架构、数据训练、评估体系等方面有突破,还将开源成果推动生态发展。

机器之心
开源动态9

刚刚,Kimi K3开源!3万亿模型权重全球开放

2026年7月27日,Moonshot AI开源全球首个3万亿参数级模型Kimi K3。它不仅参数量,还在多领域表现出色,能与顶尖闭源模型媲美。其架构创新、训练独特、推理成本低,有望改变全球模型格局。

新智元
新闻资讯8

LeCun点赞:国产开源模型占领硅谷,性价比超10倍

硅谷被中国开源模型占领,Cursor、Cognition等公司模型被曝套壳或基于中国开源模型训练。巨头如Meta也用Qwen做训练,爱彼迎等青睐Qwen。因性价比高,中国开源模型在硅谷走红。

量子位
开源动态8

蚂蚁dInfer框架,让扩散语言模型推理速度再飙10倍,相同模型性能下超越自回归模型

蚂蚁开源dInfer框架,联合名校发论文阐述实现细节。它解决扩散模型推理难题,提出创新算法和系统优化策略,实验显示其推理速度远超Fast - dLLM和自回归模型标杆vLLM,代码已开源。

AIGC开放社区
新闻资讯8

独家解读|2025年AI五趋势与底层数据革命

2025 年 AI 发展重心转移,高质量数据成新基石。本文解读五技术趋势,如多语种 TTS 与全双工交互、多模态模型等,还介绍了各趋势的数据需求及数据堂提供的相应数据服务方案。

机器之心