「混合训练框架」共找到 3548 篇相关文章
当大模型陷入幻觉循环,如何用工程化给它“立规矩”?
普林斯顿和伯克利研究定义“机器胡扯”,指出大模型胡扯问题。蚂蚁集团旗下蚂蚁密算在2025 WAIC提出高阶程序(HOP)框架,为大模型注入规则,还开源此框架,其在多行业场景应用效果良好。
Kimi K2技术报告正式发布:“保姆级”深度解析,一文读懂万亿参数智能体的所有秘密
Kimi K2技术报告发布,Moonshot团队用万亿+参数稀疏MoE架构等打造接近Claude - Opus的通用大模型。围绕训练稳定性等改进,有预训练、架构设计等多方面创新,为智能体领域提供可行路径。
林俊旸从阿里离开后首度发声:推理模型的时代快结束了
前通义千问Qwen负责人林俊旸离职后发长文,指出AI正从「推理思考」转向「智能体思考」,分析推理模型发展,谈混合思考模式失败,还提及智能体思考挑战及相关企业、学术界进展。
港科广×腾讯联手打造《我的世界》神操作,400张截图就能让AI挖矿通关,成本降至5%|EMNLP 2025
港科广与腾讯联合团队提出VistaWise框架,将“跨模态知识图谱+轻量化视觉微调”引入开放世界智能体。实验显示其在“获取钻石”任务表现出色,成果被EMNLP 2025主会录用。该框架以低成本、跨模态为突破口。
RAG搜对了却答错?德国萨尔大学找到了真相丨ACL'26
RAG已成大模型落地标配技术,但存在搜到对的文档、模型答案却离谱的痛点。德国萨尔大学等组成的团队诊断出问题在阅读理解,提出Disco - RAG框架,在“搜”和“答”间加“读懂”环节,已被ACL 2026主会录用。
100美元、仅8000行代码,复现ChatGPT,Karpathy:这是我写过的最疯狂的项目
特斯拉前AI总监Andrej Karpathy发布全新开源项目「nanochat」,是极简且完整的「从零构建ChatGPT」训练框架。不到12小时GitHub星标破4.2k。约8000行代码,花100美元、4小时就能训练出专属「小ChatGPT」。
面壁MiniCPM-SALA模型,稀疏-线性注意力,单卡吞吐百万上下文
面壁智能团队提出SALA,基于此训练的MiniCPM-SALA模型,在单张A6000显卡实现百万token超长上下文推理,训练成本降约75%。它结合稀疏与线性注意力,采用混合架构,继承权重降低成本,在长文本处理上优势明显。
大道至简,何恺明团队新作pMF开启像素级「无潜、单步」生成范式
何恺明团队新论文提出用于单步、无潜空间图像生成的pMF框架,直指主流扩散与流匹配模型通病。该框架将v、u和x三个场关联,训练网络把噪声输入直接映射为图像像素,实验表现强劲。
数据合成篇|多轮ToolUse数据合成打造更可靠的AI导购助手
文章以租赁导购助理“小不懂”为例,介绍Tool Use训练数据合成方案。先分析训练数据的目标与难点,提出动态多智能体对话生成框架,阐述多轮数据、复杂问题合成及过滤方案,展示数据和模型效果,还提及未来工作方向。
CVPR 25 |全面提升视觉感知鲁棒性,生成模型快速赋能三维检测
香港中文大学(深圳)等单位学者提出 DriveGEN 无训练自动驾驶图像可控生成方法,无需额外训练生成模型,通过两阶段策略扩展训练数据,提升三维检测模型鲁棒性,代码已开源。