「机器学习算法」共找到 2005 篇相关文章
腾讯混元AI Infra如何优化Hy3 Preview:一次大模型推理性能提升的技术拆解
文章聚焦腾讯混元AI Infra对Hy3 preview模型的推理性能优化。从算子优化与融合、并行策略等五大维度,剖析技术思路、算法及收益,如Attention算子单batch长文本最高加速2.95x,还提及后续显存优化等工作。
英伟达4B小模型击败GPT-5 Pro!成本仅1/36
英伟达ARC - AGI 2中,4B小模型NVARC以27.64%成绩力压GPT - 5 Pro登顶,单任务成本仅其1/36。亮点是零预训练深度学习法,还靠合成数据、测试时微调等策略。小模型特定领域优化后优势明显。
在「外滩大会·具身智能:从泛化到行动,重塑产业未来」上,这些大牛都说了什么?
9月11日,机器之心联合出品的外滩大会见解论坛聚焦具身智能。多位学界和业界代表分享看法,如孙富春称训练场可破数据瓶颈,江磊指其是新型数据工厂。思辨和圆桌环节探讨技术路线、应用场景等关键问题。
英伟达&MIT等推出Long-RL,长视频训练速度翻倍
英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。
大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱
CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。
这一夜,中国AI彻底翻身了:DeepSeek R1让全世界刮目相看 | 深度评测
作者深度测试新DeepSeek R1,发现其代码生成能力超Claude 3.7,虽编程全面性有不足,但已处Claude 3.7与Claude 4之间。前端设计审美达Claude 4水准,部分方面略胜,有自主学习推理能力,或改变中国AI历史。
Google 悄悄升级了 Deep Think,ARC-AGI-2 直接干到 84.6%
Google DeepMind 升级了 Gemini 3 的专用推理模式 Deep Think,跑分屠榜。ARC - AGI - 2 拿下 84.6%,在多个基准测试中表现优异。它不仅是解题机器,还能解决真实科学工程问题,已向部分用户推送,科研人员和开发者可通过 API 使用。
AMD服务器上一个诡异的性能问题诊断历程
本文复盘AMD服务器高优故障,从8月底起,集团amd turind机器业务cpi和cpu利用率飙升,影响业务性能。经排查是split lock问题,由python解释器调用__libc_free时出错引发,还分析了问题原因、传导路径,并给出应对措施。
AAAI 2026 Oral:明略科技开创稀疏数据「信息瓶颈动态压缩」,精度+速度双SOTA
在机器人和具身智能领域,transformer模型又大又‘重’,边缘设备难以承受。东南大学、中南大学、明略科技联合提出的CompTrack论文,创新性解决AI模型处理稀疏数据的‘双重冗余’,在3D点云跟踪任务上实现精度和速度双优。
全球首个「百万引用」学者诞生!Bengio封神,辛顿、何恺明紧跟
Yoshua Bengio成谷歌学术首个论文引用超百万的人,Geoffrey Hinton达97万次。全球高被引TOP 10中,计算机领域占4席,均属AI领域。深度学习论文引用爆发,契合AI时代。还介绍了Bengio、何恺明等AI领域高被引作者情况。