交错式训练策略」共找到 2807 篇相关文章

开源动态8

对抗协作+原型学习!深北莫FedPall开源,联邦学习破局特征漂移,准确率登顶SOTA

深圳北理莫斯科大学人工智能研究院在ICCV发表FedPall算法,结合原型对比与对抗协作学习,在多种特征偏移数据集获SOTA性能。该算法通过多步骤训练缓解特征漂移,在多个公开数据集表现出色。

机器之心
推荐文章7

秋分|皮影裁秋色

秋分时节,皮影戏这一古老民间娱乐活动光影交错、魅力独特,2011年被列入非遗名录。艺术家邬建安将皮影等传统技艺融入创作。2025年798节气海报以节气和非遗工艺为主题进行AI创作。

798艺术区
开源动态8

刚刚,美团开源 SOTA 推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking

美团宣布开源高效推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking,是国内首个结合多种推理能力的大语言模型。它采用新方法提升性能,已在多平台开源,API 平台免费开放,还兼容主流 API 格式。

AGI Hunt
新闻资讯7

刚刚!Thinking Machines Lab | 长文揭开LLM推理不确定性真相!

Thinking Machines Lab发布《克服LLM推理中的不确定性》,揭示大语言模型推理不确定性原因,并非“并发 + 浮点”假设那么简单,主要是负载及batch size不确定所致,还给出让核函数有批次不变性的方法及实验结果。

AINLPer
开源动态8

重磅!Thinking Machines开山之作:大模型输出随机的根本原因被揪出,并开源终结方案

由OpenAI前CTO创办的Thinking Machines宣布上线技术研究博客,开篇文章揪出LLM输出随机的根本原因是负载及批次大小的非确定性变化,并给出系统性解法,还开源方案。

AI寒武纪
算法论文7

从数据分布视角,重新认识下CoT

本文从数据分布视角重新审视大语言模型的思维链(CoT)推理。指出CoT并非真正推理,而是模仿,其效果受训练与测试分布差异影响。通过实验揭示CoT在分布偏移时性能退化,提醒勿过度依赖。

深度学习自然语言处理
8

技术奇点与产业拐点:五位顶级投资人的共识与分歧|甲子光年

8月21日「2025甲子引力X中国科技产业投资大会」上,五位顶级科技投资人探讨科技投资。有人从数据看到拐点,如中国Biotech公司License out金额超美;有人从细微处找真相,如科技企业盈利。大家还交流了创新定义、AI引爆点等。

甲子光年
推荐文章8

吴恩达来信:智能体并行运行以提升效率

吴恩达称并行智能体成扩展AI规模新方向。AI性能会随数据量、训练及推理计算量提升,但耗时久。随着LLM每个token价格下降,更多智能体工作流被并行化,且相关研究增多。

DeeplearningAI
产品应用8

杭州跑出的AI独角兽,突围大模型的“第二战场” | 甲子光年

2025年AI行业有转变,算力堆叠对大语言模型性能提升放缓,空间智能成“第二战场”。谷歌、英伟达等巨头纷纷布局,群核科技作为杭州“变量”,发布业界首个3D室内空间大模型,构建数据飞轮,技术有望落地多领域。

甲子光年
新闻资讯7

全网爆火的DeepSeek「UE8M0 FP8」,原来英伟达早已支持

NVIDIA PTX ISA文档早有.ue8m0数据类型,UE8M0 fp8并非DeepSeek独创。从PTX 8.0/9.0起,NVIDIA在ISA级别支持.ue8m0,H100、RTX 40系列等都有相关支持,DeepSeek是将其提升到模型层面。

AI寒武纪