「大涡模拟网络」共找到 5431 篇相关文章
拆解大模型几项核心操作背后的数学与 Infra 优化逻辑
文章拆解大模型核心操作(RMSNorm、Softmax、Causal Mask、Sampling)背后的数学与Infra优化逻辑。指出Infra优化是用数学等价变换或精度妥协换硬件利用率和推理速度,还介绍各操作原理、问题及优化方法。
人大高瓴-华为诺亚:大语言模型智能体记忆机制的系列研究
中国人民大学高瓴人工智能学院与华为诺亚方舟实验室聚焦大语言模型智能体记忆能力,形成含综述论文、数据集和工具包的研究体系。探讨记忆概念、重要性、实现与评测方法,还构建评测榜单、实现工具包。
重磅发现!大模型的「aha moment」不是装腔作势,内部信息量暴增数倍!
中国人民大学等联合团队研究发现,大模型推理有“信息脉冲”,特定步骤互信息值飙升形成“互信息峰值”,对应“思考词汇”。基于此提出无需额外训练提升推理性能的方法,代码已开源。
Anthropic发最高警告:0day大爆发即将来临!全球巨头瞬间蒸发数十亿
Anthropic发布新模型预览版Claude Mythos Preview,它在测试中表现惊人,致网络安全巨头Cloudflare股价暴跌。这动摇了SaaS帝国根基,Anthropic启动计划发布生存指南,却遭顶级黑客质疑。
只要交钱,高中生也能发NeurIPS?港大教授怒批顶会变味
在AI浪潮下,学术研究被商业机构「量产化」,成明码标价的「入学筹码」。港大教授马毅揭露乱象,如Algoverse机构指导团队顶会录用率高,高中生也能发文。付费论文收割家长「焦虑税」,还带来诸多学术问题。
大模型推理加速全链路:内存管理、编译优化、量化与并行策略
本文整理自金煜阳博士在QCon大会分享。介绍大模型推理挑战,如规模增大、架构复杂。阐述算子优化、内存管理、量化、异构调度和并行优化方法,还介绍开源推理引擎赤兔在国产芯片的实践成果。
AI大模型开发核心技术栈:从框架到部署的全景解析
本文为开发者提供2025年AI大模型开发核心技术栈图谱,解析四大核心支柱技术。基础开发框架含深度学习与AI Agent框架;模型训练与微调有分布式训练、参数高效微调;推理优化含关键技术与主流框架;AI编程辅助工具分主流形态且有发展趋势。
北大团队发布首篇大语言模型心理测量学系统综述:评估、验证、增强
随着大语言模型(LLM)能力迭代,传统评估方法难满足需求。北大宋国杰教授团队论文首次系统梳理LLM心理测量学研究进展,革新评估原则,扩展测量构念与方法,还给出增强方法与未来研究方向。
2026夏季崇礼论坛五大看点,AI如何走进生活|甲子光年
2026年9月12 - 13日,2026夏季崇礼论坛将在崇礼·太舞小镇举行,主题为“未来此刻”。有五大看点,包括俞敏洪等探讨AI能力与入口,揭晓“AI NEXT 20”榜单,多场硬件、内容等相关圆桌及产品展示。
空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没
上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。