低精度训练」共找到 3119 篇相关文章

产品应用8

字节跳动Seed推出「机器人大脑」Robix:让机器人学会思考、规划与灵活互动

近日,字节跳动Seed团队发布「机器人大脑」Robix,它将推理、任务规划与人机交互整合到单个端到端多模态模型。通过层次化架构分工,它能灵活互动,经三阶段训练,在多方面表现出色,为具身智能体发展奠基。

机器之心
推荐文章7

几毛钱的芯片,利润直追英伟达

苹果曾被小小基带芯片困扰,芯片世界里有很多单价、工艺要求不高的“小玩意”,但其利润却直追英伟达。如英飞凌、博通,它们靠“人脉”和网络效应赚钱,且所在领域不卷,抱着铁饭碗。

芯师爷
算法论文8

多模态模型学会“按需搜索”,少搜30%还更准!字节&NTU新研究优化多模态模型搜索策略

字节与NTU优化多模态模型搜索策略,通过搭建工具、构建数据集及设奖励机制,用强化学习训练模型,使其按需搜索。实验显示,MMSearch - R1系统少搜30%还更准,为多模态大模型发展提供洞见。

量子位
新闻资讯8

阿里安全AGI一次发布3款LLM,8B多维度领先GPT-5.4

近期,阿里安全AGI实验室发布3款Yuvion LLM,在AI安全与内容安全领域多维度领先。它以‘对抗即智能’为原则,构建五类数据体系,采用三阶段训练范式,通过YLRE四级评测体系验证能力。

PaperAgent
产品应用8

GPU利用率不到15%,AI产业最大的浪费正在被这家公司改写|甲子光年

AI产业发展中算力成本高、利用率问题凸显。趋动科技押注‘软件定义GPU’,试图把独占GPU变为共享算力池,其产品使客户GPU利用率平均提升约4倍,已服务超200家头部客户。

甲子光年
开源动态8

用2D先验自动生成3D标注,自动驾驶、具身智能有福了丨IDEA团队开源

IDEA团队张磊团队提出OVSeg3R开集3D实例分割学习新范式。它无需人工后处理和3D掩码标注,降训练成本,有望让3D实例分割商业落地,可用于自动驾驶、智能家居等领域。

量子位
产品应用7

学生3年投稿6次被拒,于是吴恩达亲手搓了个评审Agent

机器学习大佬吴恩达为投稿屡被拒的学生,做了免费AI论文评审智能体。它在ICLR 2025审稿数据训练,与人类审稿相关系数达0.42,能按会议风格评审,还提修改建议,可体验。

量子位
算法论文7

ACL2025 | 抓出0.1%的捣乱分子压缩方法OTT:近乎无损 超越KIVI,内存减6.4倍 吞吐量提2.3倍

LLM生成文本时KV Cache内存占用高,限制模型批量处理能力。论文提出OTT方法,动态追踪异常令牌单独高精度保存,其余压缩。实验显示,它准确性高、效率好,不过在极短文本等场景有局限。

深度学习自然语言处理
算法论文8

英伟达护城河被AI攻破,字节清华CUDA Agent,让人人能搓CUDA内核

近日,字节跳动Seed团队和清华AIR的CUDA Agent引发轰动。它能编写经优化的CUDA内核,性能超torch.compile等。研究发布CUDA - Agent - Ops - 6K数据集,介绍系统管线设计、训练流程,实验结果佳,但有未对比复杂编译器等局限。

机器之心
新闻资讯7

马斯克最大算力中心建成了:全球首个GW级超算集群,再创世界纪录

全球首个GW级超算集群Colossus 2正式投入运行,马斯克称其4月将升级至1.5GW。这为Grok 5训练提供强大算力。但美国部分地区因数据中心电力需求激增,或在用电高峰对居民轮流停电。

量子位