大模型发布」共找到 10202 篇相关文章

推荐文章8

从RLHF、PPO到GRPO再训练推理模型,这是你需要的强化学习入门指南

强化学习是当今LLM重要技术,Unsloth团队发布教程,从吃豆人谈起,介绍RLHF、PPO到GRPO,分享用GRPO训练推理模型技巧,涵盖相关概念、训练方法及奖励函数设计等内容。

机器之心
算法论文8

逆天!Mata用13个参数26字节让模型正确率从76%飙升至91%

Meta等机构研究人员发布TinyLoRA极致微调技术,配合强化学习,能在几乎不改变模型原有结构下,用极少数参数激发其推理能力。该技术在数学推理上表现出色,还探索了参数共享策略和存储精度问题。

AIGC开放社区
新闻资讯7

咖云集「2025甲子引力年终盛典」首批嘉宾公布,共赴思想盛宴|甲子引力

2025年12月3日,「2025甲子引力年终盛典」将在北京万达文华酒店举办,主题为“轰然成势,万象归一”。活动公布首批嘉宾,包括汪玉、董彬等。还有智库报告发布、巅峰对话和三专场等看点。

甲子光年
新闻资讯8

智源悟界·Emu3.5发布,开启“下一个状态预测”!王仲远:或开启第三个 Scaling 范式

2025年智源发布悟界·Emu3.5,在“Next-Token Prediction”基础上实现“Next-State Prediction”。它能力全面提升,或开启第三个Scaling范式,还在预训练、强化学习、推理加速上有技术创新。

AI前线
算法论文7

Energy | 西工史子颉、高传强等:三维风力机叶片动态失速数据融合建模研究

动态失速威胁风力机叶片安全与发电效率,传统模型有局限。西工团队开发数据融合神经网络与动量叶素理论耦合框架,能高效高精度预示三维叶片动态失速,虽部分工况有偏差,但预测精度显著提升。

力学与人工智能
产品应用8

GPT-5.4 发布,OpenClaw的能力要被取代?OpenAI 新模型不仅会自己用电脑,编程能力也拉满了

今天 GPT-5.4 发布,整合推理、编程及原生计算机使用能力。其原生电脑操作能力提升,与 OpenClaw 竞争。还带来工具搜索降成本、减少幻觉,编程能力增强但价格也升级。

AI前线
产品应用7

500万次围观,1X把「世界模型」真正用在了机器人NEO身上

1X公司为机器人NEO引入1X World Model,使其学会‘想象’。该模型借助视频预训练,不依赖规模机器人数据和遥操作演示,能泛化到新场景。实验显示其在多任务上表现不错,但精细操作有挑战。

机器之心
新闻资讯8

头部互联网企业交锋,AI时代可观测边界出现了吗?

InfoQ《极客有约》X AICon 直播栏目邀阿里云张城等探讨AI时代可观测新边界。嘉宾们认为AI与可观测技术双向赋能,传统算法与模型互补,未来有望实现半自治运维,还分享了数据治理等经验。

InfoQ
开源动态7

全球闲置算力训个模型,性能媲美R1,老黄天塌了!Karpathy曾投资它

全球首个分布式RL训练模型INTELLECT - 2发布,整合闲置算力完成训练,成本降低,性能媲美DeepSeek - R1。其采用分布式异步强化学习范式,团队开源四关键组件,还获Karpathy等投资,未来有多项计划。

量子位
算法论文8

RL 将如何提高具身模型 VLA 泛化性?清华学团队NeurIPS 2025文章分析 RL 与 SFT 泛化性差异

清华学团队在NeurIPS 2025发表文章,揭示强化学习(RL)提升具身模型VLA泛化能力的优势,对比其与SFT差异,还提出评测基准和训练方法,为VLA训练提供新方向。

机器之心