H3模型」共找到 8505 篇相关文章

新闻资讯7

奥特曼仓促亮剑GPT-5.2!一张图爆火全网,全面碾压Gemini 3

谷歌发布Gemini 3,其惊艳表现打乱OpenAI阵脚,公司进入「红色警戒」,将提前于12月9号发布GPT - 5.2应对。网传GPT - 5.2测试分数全面超Gemini 3 Pro,但遭网友质疑。OpenAI面临用户流失等危机。

新智元
开源动态8

7×24h「全职AI员工」爆火硅谷!退休码农让Mac mini一夜卖爆

由Peter Steinberger开发的开源项目Clawdbot爆火硅谷,它可在Mac mini上运行,能调用多种模型,还能通过聊天APP对话。它解决了主流大模型记忆力痛点,重塑了个人AI超级助手定义,还带火了Mac mini。

新智元
开源动态8

超越DeepSeek-R1,英伟达开源新王登顶!14万H100小时训练细节全曝光

英伟达Llama - Nemotron系列模型超越DeepSeek - R1且全部开源。论文揭秘其训练关键,如用合成数据监督微调与强化学习等。还介绍构建阶段、架构设计等,评估显示该系列模型在多任务表现出色。

新智元
推荐文章7

新手必看!强化学习入门指南 | 从RLHF、PPO、GRPO到RLVR,最后到训练推理模型

Unsloth团队发布强化学习教程,从吃豆人谈起,介绍RLHF、PPO、GRPO等概念,分享用GRPO训练推理模型技巧。涵盖强化学习基础知识,还给出Unsloth使用GRPO训练模型方法及奖励函数示例。

AINLPer
算法论文7

剑桥揭开大模型翻车黑箱!别再怪它不懂推理,是行动出错了

剑桥大学等机构研究指出,大模型执行长时任务易翻车,问题不在推理而在执行能力。研究人员评估多个指标,发现单步准确率提升可让任务长度指数增长,还研究了自条件化等影响及模型规模的作用。

新智元
算法论文7

让推荐学会思考:用强化学习激活大模型的序列推理能力

文章指出推荐系统曾未紧密结合大模型能力,如今正靠近其训练范式。作者基于用户行为序列,用强化学习训练大模型理解序列关系,以预测用户下一个可能点击的资讯,并通过实验验证了该方法的可行性,还探讨了不同数据库中BM25算法的差异。

AI科技评论
算法论文8

传统训练效率很低?我们靠 “给模型降噪” 重新审视长上下文建模难题

文章指出长上下文模型处理长文本时易受噪声干扰,提出新评估指标IG分数和“上下文去噪训练(CDT)”方法。实验表明CDT优于现有策略,经其训练的开源模型在长上下文任务中性能媲美GPT - 4o。

深度学习自然语言处理
算法论文8

拒绝“熵崩塌”和“熵爆炸”!这项研究让大模型学会“精确探索”,推理成绩飙升

2024年以来,大模型在推理任务上进展显著,得益于RLVR方法,但面临“熵困境”。研究团队提出选择性熵正则化方法(SIREN),通过三重机制精准调控探索行为,实验证明其能提升模型推理成绩。

量子位
新闻资讯8

「全球大模型第一股」来了!智谱港交所敲钟,市值达528亿港元

2026年1月8日,智谱登陆港交所,成全球首家以AGI基座模型为核心业务的上市公司,市值528.28亿港元。它以‘全球大模型第一股’吸引资本,研发强、MaaS模式优,标志中国AGI企业走向资本市场。

新智元
算法论文8

从显式CoT到隐式CoT:复旦让AI告别啰嗦,实现大模型高效沉默推理

复旦大学等机构团队论文提出SIM - CoT技术,解决隐式思维链推理准确率低、不稳定问题。该技术引入步骤级监督,提升性能、效率和可解释性,在多模型和任务测试中表现出色,让大模型高效沉默推理。

AIGC开放社区