国科大」共找到 5050 篇相关文章

算法论文8

模型越反思越错,原来是长链推理通过自我说服加重幻觉 | 北邮

北邮研究团队通过思维链审计实验,揭示模型长链推理‘越想越错’现象背后的元认知偏差。研究基于RFC协议文档构建受控知识域,分析推理过程,发现反思会加重幻觉,且现有检测方法难以应对。

量子位
产品应用7

一家智能眼镜公司,为什么非要自研AI模型系统?|甲子光年

智能眼镜要么不够智能,要么不像眼镜,李未可科技CEO茹忆认为AI要成第一响应者。该公司推三款AI眼镜,搭载自研系统。其自研AI模型系统,是为交付难复制AI体验闭环,解决通用API不足等问题。

甲子光年
产品应用8

首个高考数学满分AI诞生!海淀名师审题,给出惊艳超高分

豆包爱学App的AI挑战高考数学全国卷,经6位资深名师严格把关,获Ⅰ卷144分、Ⅱ卷150分满分。其解题过程出色,虽有小问题但可解决,对师生帮助,预示AI教育将变天。

新智元
算法论文8

模型最后一层竟是推理累赘?绕开对齐税,奥数准确率暴涨 22.4%!

Qwen团队等最新研究打破传统认知,揭示‘对齐税’现象。提出置信解码策略,在多架构、评测集上表现出色,能绕过‘对齐税’,提升推理准确率,且工程开销低,为模型发展提供新思路。

量子位
开源动态8

社区供稿 | 开源SOTA:阶跃发布端到端语音模型Step-Audio 2 mini!

阶跃星辰发布最强开源端到端语音模型 Step - Audio 2 mini,在多个国际基准测试集获 SOTA 成绩。它统一建模语音理解等,率先支持语音原生 Tool Calling 能力,架构创新,案例展示其多方面强能力。

Hugging Face
算法论文8

省下1.25倍算力!Kimi这篇论文,可能改写所有模型的训练方式

模型层数增多时,残差连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。

AI寒武纪
算法论文7

估值840亿AI实验室再放招,他们要给模型戴上「紧箍咒」

新智元报道,OpenAI前CTO创办的Thinking Machines Lab发布研究「模块流形」,将传统数值修正转为「预防式」约束优化。它提出新范式,为训练模型提供新思路,还介绍了流形优化器及相关算法。

新智元
开源动态8

LLM开源2.0洗牌:60个出局,39个上桌,AI Coding疯魔,TensorFlow已死

9月13日蚂蚁集团开源团队发布LLM开源2.0全景图,收录114个项目,39个新晋、60个出局。生态洗牌,Agent层活跃,分类架构细化。AI Coding等领域发展显著,TensorFlow不敌PyTorch,还梳理厂商模型发布情况。

机器之心
产品应用8

模型提速80%,华为拿出昇腾推理杀手锏FlashComm,三招搞定通算瓶颈

模型推理通算难题凸显的背景下,华为数学家祭出 FlashComm。它包含三项技术,分别在 AllReduce 通信、以存换传、多流并行方面优化,解决通信瓶颈,提升推理性能,未来还将围绕多方向创新。

机器之心
算法论文8

参数量暴降,精度反升!哈工联手打造点云分析新SOTA

哈工(深圳)和宾联合团队推出基于KANs的3D感知解决方案PointKAN,能处理点云数据下游任务。它替代MLP,有更强学习几何特征能力。还提出PointKAN - elite,降参保量。实验表现出色。

量子位