「单token验证」共找到 1922 篇相关文章
智源悟界·Emu3.5发布,开启“下一个状态预测”!王仲远:或开启第三个 Scaling 范式
2025年智源发布悟界·Emu3.5,在“Next-Token Prediction”基础上实现“Next-State Prediction”。它能力全面提升,或开启第三个Scaling范式,还在预训练、强化学习、推理加速上有技术创新。
ENG APPL COMP FLUID | 西北工业大学赵书乐、张伟伟:欧拉方程嵌入的壁面压力和摩阻分布机器学习方法
传统气动力建模依赖大量样本、泛化能力弱。本文将欧拉方程无粘特征融入建模,配合架构与损失函数设计,让模型在复杂状态保持泛化能力,集中力误差约3%,小样本建模时样本量比传统方法降2倍以上。
DeepSeek突然拥抱国产GPU语言!TileLang对标CUDA替代Triton,华为昇腾Day0官宣支持适配
DeepSeek v3.2开源TileLang版本算子引关注,其可对标CUDA替代Triton,还适配国产算力生态,华为昇腾官宣支持。TileLang由北大团队主导,提供不同层次编程接口,助DeepSeek提升性能。
Mini-Omni-Reasoner:实时推理,定义下一代端到端对话模型
现有端到端对话模型推理能力未解锁,因深度思考带来延迟。为此提出 Mini - Omni - Reasoner,采用边思考边表达范式,突破‘要么快,要么准’困境,还设计了数据合成管线和五阶段训练方法,实验证明其性能提升明显。
AI股大爆发!甲骨文单日增长40%,创始人超马斯克成世界新首富
甲骨文公布AI云业务强劲增长预期,股价单日暴涨40%,创始人成世界新首富。受其带动,多只AI股上涨。OpenAI将与甲骨文签3000亿美元算力采购协议,但双方合作有风险,甲骨文债务比例高。
全球开源大模型,前十五名全是中国的
近日,随着新一代大语言模型更新,开源大模型成热门话题。Design Arena排行榜上,若设定为“开源”,前15名均为国产开源大模型,排名第一的是DeepSeek - R1 - 0528 ,智谱、阿里等厂商多款模型上榜。
刚刚!OpenAI训练GPT-4b攻克诺奖级“细胞再生”难题:效率狂飙50倍,连DNA损伤都能修复
OpenAI联手Retro Biosciences研发GPT - 4b micro用于蛋白质工程,让诺奖级细胞再生技术效率提升50倍,设计的新蛋白质还有DNA损伤修复功能,结果在多方面获验证。
抄作业了!让AI产品告别“上线就崩”的CC/CD框架,6步搞定,拿走不谢。
文章指出AI产品因大模型不确定性,易上线翻车。介绍海外流行的CC/CD开发框架,阐述AI产品不确定性原因,强调自主与控制平衡,还给出该框架落地的6步工作流。
ICML spotlight | 一种会「进化」的合成数据!无需上传隐私,也能生成高质量垂域数据
大模型发展使数据短缺问题加剧,特殊领域更严重。为此提出合成数据自主进化框架PCEvolve,只需少量标注样本,就能在保护隐私同时进化出数据集,还介绍了其架构、选择器设计及实验结果。
图解Vllm V1系列6:KVCacheManager与PrefixCaching
文章聚焦vllm v1,阐述调度器取请求时判断设备有无充足空间做推理的问题,涉及KVCacheManager与Prefix Caching。前者管理请求和块,后者通过找最长一致前缀节省显存,还介绍块分配释放策略与流程。