模型训练难题」共找到 8676 篇相关文章

开源动态8

腾讯太极团队实现DeepSeek模型业内H20最高性能15800+ tokens/s

腾讯太极团队揭秘实现DeepSeek模型15800+ tokens/s业内H20最高性能的方法,通过PD分离、多层MTP优化等全栈优化方法论,还介绍多机性能优化方案,后续预计性能突破20000 tokens/s。

腾讯技术工程
算法论文7

关于多模态大模型Token压缩技术进展,看这一篇就够了

多模态大模型跨模态融合带来高计算成本,催生MLLM Token Compression研究。北大等机构人员基于压缩位置对方法系统归类,讨论特定场景压缩机制选择,还探讨了挑战与前景方向。

机器之心
开源动态8

阿里王牌Agent横扫SOTA,全栈开源力压OpenAI!博士级难题一键搞定

阿里昨晚开源通义DeepResearch,在多项权威基准上表现出色,超越OpenAI、DeepSeek。模型、框架、方案全开源,开发者可在相关平台下载。它告别一问一答模式,像研究员一样工作,还构建了独特数据体系。

新智元
开源动态8

刚刚,OpenAI 再次开源!安全分类模型 gpt-oss-safeguard 准确率超越 GPT-5

OpenAI 开源安全分类推理模型 gpt-oss-safeguard,有 120b 和 20b 参数量版本,采用 Apache 2.0 许可证。它能直接理解策略文档分类内容,推理能力超 GPT - 5,性价比高,虽有局限但仍是开发者利器。

AGI Hunt
推荐文章8

模型如何推理?斯坦福CS25重要一课,DeepMind首席科学家主讲

Google DeepMind首席科学家Denny Zhou在斯坦福CS25课程分享大语言模型推理见解,总结了四个关键点,阐述推理机制、优化方法及最新进展,还介绍多种推理方法并比较其优劣。

机器之心
算法论文7

拆解大模型几项核心操作背后的数学与 Infra 优化逻辑

文章拆解大模型核心操作(RMSNorm、Softmax、Causal Mask、Sampling)背后的数学与Infra优化逻辑。指出Infra优化是用数学等价变换或精度妥协换硬件利用率和推理速度,还介绍各操作原理、问题及优化方法。

腾讯技术工程
新闻资讯7

OpenAI「解决」10道数学难题?哈萨比斯直呼「尴尬」,LeCun辛辣点评

OpenAI研究员宣称GPT - 5「发现」10个悬赏数学难题的解决方法,舆论误以为是解题方法,后发现只是检索到已有文献,引发学界大佬群嘲和对AI夸大宣传的讨论。

机器之心
算法论文8

人大高瓴-华为诺亚:大语言模型智能体记忆机制的系列研究

中国人民大学高瓴人工智能学院与华为诺亚方舟实验室聚焦大语言模型智能体记忆能力,形成含综述论文、数据集和工具包的研究体系。探讨记忆概念、重要性、实现与评测方法,还构建评测榜单、实现工具包。

机器之心
新闻资讯7

MMLU已死?「人类最后考试」登Nature:全球AI模型集体不及格!

AI发展迅猛,现有基准测试难以跟上其步伐。近1000名研究人员组成的全球联盟创建「人类最后的考试」(HLE),涵盖多领域难题,目前最强AI准确率不足50%,凸显AI与人类专家的差距。

新智元
算法论文8

AI模型守法率提升11%,港科大首次用法案构建安全benchmark

香港科技大学KnowComp实验室从法律合规视角研究LLM安全,提出「安全合规」新范式。基于法律条文构建benchmark,用GRPO微调Qwen3 - 8B得推理模型,在新benchmark测试中性能提升显著。

新智元