「两阶段流程」共找到 2005 篇相关文章
OpenAI IPO计划第一步曝光,奥特曼骚操作看傻华尔街
最新消息,软银批准对OpenAI剩余225亿美元投资,条件是年底前完成重组为上市铺路。同时,奥特曼绕过投行和律师操盘芯片交易,其非常规操作遭分析师批评,交易承诺收入能否兑现未知。
名师一定出高徒?清华团队最新揭秘:别再迷信大模型蒸馏的「免费午餐」
当下大模型后训练中,On-Policy Distillation(OPD)成明星技术,业界采用后报告性能提升。但清华团队研究发现,换更强Teacher,Student性能可能无提升甚至倒退。研究揭示蒸馏成败条件,深挖对齐机制,还给出拯救失败蒸馏的方法。
算力不再稀缺?中国AI芯片供给出现反转
过去中国AI产业常焦虑算力不足,如今国产AI芯片进入集中交付阶段,自给率提升。伯恩斯坦测算,国产化率有望从2023年约17%提至2027年约55%。产业进入新阶段,竞争从“拼参数”转向“拼体系”。
HaluMem:让AI记忆系统的“幻觉”现形——首个面向记忆系统的操作级幻觉评测基准
过去一年,AI Agent的‘记忆能力’成热门话题,但AI记忆存在幻觉问题。为此发布操作级幻觉评估基准HaluMem,它能精准定位幻觉来源,评估主流记忆系统,为构建可靠记忆系统提供方向。
刚刚,OpenAI发长篇论文:大模型幻觉的原因找到了~
OpenAI发论文揭示语言模型出现幻觉的根本原因,即训练和评估过程奖励猜测而非承认不确定性。预训练阶段就埋下幻觉种子,后训练阶段‘考试机制’强化幻觉,还给出改评分规则的解法。
数据蒸馏的双重突破:从几何保真到对抗鲁棒
深度学习中,数据集蒸馏可用精简合成样本替代庞大训练集且不牺牲模型性能,但面临精度和可靠性两大难题。两篇发表于 ICCV 2025 和 AAAI 2025 的论文分别给出解决方案,且代码已开源。
中山大学&华为联合提出 Issue Resolution 数据集构建神器SWE-Factory:每条只要$0.024
中山大学和华为联合提出低成本开源方案 SWE-Factory,可自动收集代码打造高质量代码评估数据集。它能解决传统构建流程繁琐、依赖人工的问题,实现全流程自动化,还构建了 SweSetupBench 数据集,表现出色。
提效40%?揭秘AI驱动的支付方式“一键接入”系统
文章围绕AI驱动的支付方式“一键接入”系统展开。先指出跨境支付接入流程痛点,介绍借助Qwen Coder + MCP工具链构建提效系统的目标。接着阐述技术架构、流程,以及提升AI采纳率的方法,最后展示效果、规划未来。
SGLang Custom AllReduce v1 与 v2 实现原理详解
文章聚焦 SGLang 里两代自定义 all-reduce 实现(v1 和 v2),前者从 vLLM 移植,后者是默认版本。详述其负载特征、前提条件、分发链、同步机制、算法及 CUDA graph 支持等内容,还对比了两代差异,并提及相关环境变量。
6.1B打平40B Dense模型,蚂蚁开源最新MoE模型Ling-flash-2.0
蚂蚁百灵大模型团队开源 MoE 大模型 Ling-flash-2.0,其以轻量级配置展现卓越性能,在推理速度、任务性能、部署成本间找到新平衡,为大模型‘参数膨胀’提供新路径,还在多领域应用表现出色。