训练技术」共找到 4623 篇相关文章

算法论文8

1.5B刷新数学代码SOTA!快手&清华精细化Token管理,LLM推理能力飙升

快手与清华团队用1.5B参数小模型在推理基准上超越同量级SOTA。其Archer方法通过精细化Token管理,对知识型和推理型Token差异化训练,让知识和推理同步更新且互不干扰,在数学和代码任务表现出色。

量子位
新闻资讯7

禁令之下,黄仁勋再用“阉割芯片”抢夺中国市场

美国芯片出口管制冲击英伟达,其在中国市场损失大、份额降。黄仁勋计划7月推‘阉割芯片’B20、B40/B30抢市场。不同客户有选择倾向,同时国产GPU有机会也面临难题,企业还尝试海外训练模型。

芯师爷
新闻资讯7

AI眼镜:又怕小米做,又怕小米不做

过去一年AI眼镜产品密集落地,小米和Rokid跻身全球出货量前三。市场处于“又怕小米做,又怕小米不做”的微妙氛围,大厂试水但未全力投入,给中小厂商留下建立技术壁垒的窗口期,显示技术或成首个分水岭。

远川科技评论
新闻资讯8

三大头部互联网企业交锋,AI时代可观测边界出现了吗?

InfoQ《极客有约》X AICon 直播栏目邀阿里云张城等探讨AI时代可观测新边界。嘉宾们认为AI与可观测技术双向赋能,传统算法与大模型互补,未来有望实现半自治运维,还分享了数据治理等经验。

InfoQ
开源动态8

6.1B激活,三榜开源第一!蚂蚁·安诊儿医疗大模型发布

由浙江省卫生健康信息中心等联合研发的开源医疗语言模型AntAngelMed发布。它基于Ling - flash - 2.0,100B总参数仅激活6.1B达约40B密集模型性能,在多个权威医疗基准测评中居前列,采用三阶段训练流程,高效MoE架构。

AIGC开放社区
新闻资讯7

xAI解散,但Grok还在上新,马斯克官宣新模型

xAI 解散、大批成员离职后,马斯克透露 Grok 最新模型进展,参数量 1.5T 的 Grok V9 - Medium 已完成训练,预计两到三周内发布。他还宣布现有 0.5T 模型年底前开源,此外首款编码智能体 Grok Build 也备受关注。

机器之心
推荐文章8

AutoResearch实战:让AI自己训YOLO,mAP从0.729到0.773

本文作者复盘用AutoResearch训练YOLOv8模型全过程。先介绍其要素框架,选YOLOv8 + NEU - DET做实验,经V1轻量验证后升级到V2完整闭环,64轮实验后mAP从0.729提至0.773,还总结工程结论并给出迁移场景建议。

机器学习AI算法工程
开源动态8

老黄杀入OpenClaw战场!最强开源「龙虾」模型直逼Opus 4.6

英伟达推出新一代开源模型Nemotron 3 Super,专为大规模AI智能体打造,有1200亿参数,推理快、吞吐量高,性能直逼Claude Opus 4.6等。它解决了Agent应用的难题,还开源了相关数据和训练方法。此外,英伟达还在打造NemoClaw开源AI智能体平台。

新智元
算法论文8

阿里:RL强化LLM推理,是技巧还是陷阱?

近年来,强化学习(RL)成为解锁大型语言模型(LLM)复杂推理能力的关键工具,但该领域也面临技术选择困境。阿里联合多所高校的论文通过大规模可复现实验,揭示主流RL技巧的机制与适用场景,还发现极简组合(Lite PPO)性能超越复杂方案。

深度学习自然语言处理
新闻资讯7

澜起科技:高速互连芯片巨头历史

文章讲述澜起科技发展历程。它从电视机顶盒芯片转型内存接口、高速互连芯片,虽历经政策冲击、做空危机、供应链压力与客户竞争等挑战,但凭借技术实力和研发投入,在行业中站稳脚跟,未来有望受益于AI算力需求升级。

芯师爷