「8B大模型」共找到 8110 篇相关文章
王田苗三问具身大牛:大模型还在「拨号上网」,机器人靠什么拿下真实订单?| WRC 2026
在2026世界机器人大会的圆桌论坛上,王田苗向具身智能头部企业CXO抛出尖锐问题。嘉宾围绕量产卡点、大模型应对物理世界不确定性及产业终局生态展开讨论,并就商业化落地节奏达成共识。
DeepSeek刚提到FP8,英伟达就把FP4精度推向预训练,更快、更便宜
DeepSeek提及针对国产芯片的FP8量化设计,引发对大模型量化策略关注。不久后英伟达发力低精度量化,将NVFP4策略拓展到预训练阶段,其方案能解决核心挑战,实验证明NVFP4在大规模训练中可行。
世界模型混战,Momenta率先冲刺IPO
当下世界模型是AI领域热门且混乱的概念,主流路线有四类。Momenta的R7世界模型已量产,其CEO定位公司为物理AI基座模型构建者。Momenta率先冲刺IPO,商业模式正转型,为后续玩家提供价值评估体系。
OpenAI重大发现:GPT-4b micro改造诺奖研究,山中因子重编程效率提高50倍
OpenAI与Retro Bio合作,用新模型GPT - 4b micro设计出新型山中因子变体,使重编程效率提高50倍。此前山中因子重编程效率极低,限制其应用,此次改进是突破。研究还在多方面验证了变体效果。
出了两道真题考 GLM-5.2,Opus 4.8 和GPT 5.5 陪跑
作者对GLM - 5.2、Opus 4.8和GPT 5.5进行两项测试。一是审计Skill体系,GLM - 5.2覆盖skill数多、找出冲突多,还挖出bug;二是做世界杯夺冠推演器网站,Opus表现出色,GLM - 5.2省token,Codex有巧思但结构有缺陷。
小米的首代机器人VLA大模型来了!丝滑赛德芙,推理延迟仅80ms丨全面开源
具身机器人成科技新热点,大家期待其释放生产力。小米首代具身VLA大模型Xiaomi - Robotics - 0抓间歇停顿问题,4.7B参数规模下推理延迟仅80ms,还做三项技术创新,且全面开源。
4000万样本炼出AI读心术,刷新七榜SOTA,最强「人类偏好感应器」开源
Skywork-Reward-V2全新发布,构建超高质量千万级人类偏好样本,刷新七大评测基准SOTA。8款模型覆盖6亿至80亿参数,小体积也能媲美大模型性能。团队引入多样大规模真实人类偏好数据,提升数据规模与质量。
Qwen&清华团队颠覆常识:大模型强化学习仅用20%关键token,比用全部token训练还好
Qwen与清华LeapLab团队研究发现,大模型强化学习训练推理能力时,仅20%高熵token就能撑起效果,甚至超全部token训练。团队用此在Qwen3-32B创造新SOTA记录,还探讨了强化学习的相关特性。
Claude团队用Qwen测试全新训练方法
Anthropic最新研究提出中训练(MSM),在预训练后、后训练前给AI立规矩。实验显示,新增MSM能让通义千问两款32B大模型失准率大幅下降,还能精简微调数据。MSM与对齐微调结合,可提升模型泛化能力。
蚂蚁·安诊儿医疗大模型:正式开源并登顶权威医疗榜单
近日,蚂蚁集团联合浙江省卫生健康委开源自研的蚂蚁·安诊儿医疗大模型。它基于蚂蚁百灵大模型架构,经深度训练,是参数规模最大的开源医疗模型。该模型在多评测中表现出色,有三阶段训练流程,架构高效、推理快,已开源助力行业发展。