后训练方法」共找到 4795 篇相关文章

新闻资讯7

OpenAI官宣GPT-6 Astra,AGI时代要来了吗

OpenAI官宣GPT - 6 Astra,自称‘世界上最聪明、对齐最好的模型’,总裁称迎来AGI时代。它成绩亮眼,能直接完成工作,达网络安全阈值,训练让AI深度参与,但价格较贵。

CourseAI
产品应用7

刚刚发现,Claude桌面版支持第三方模型了,没账号也可以用Cowork,开关在这

作者年初无法用Claude账号,上周五发现Claude桌面版(Mac)支持第三方模型,开关隐蔽。还介绍配置方法,以及Claude Cowork和Code模式特点,最提及新模型及个人多模型使用情况。

MacTalk
算法论文8

80万条数据揭示隐患:AI正在「污染」病历,你的诊疗数据可能越来越不靠谱

新加坡国立大学等机构团队研究显示,AI生成临床文本用于训练新模型,会使病理信息在数据迭代中消失,降低医疗AI诊断可靠性。研究分析80多万条合成数据,还提出缓解方法

机器之心
算法论文8

天下武功,唯快不破:LLM高效架构最新最全面综述

大型语言模型虽成就辉煌,但训练成本高、推理延迟大,核心问题源于Transformer架构。这篇综述论文首次系统性梳理高效LLM架构创新方案,分类七大类方法,延伸至跨模态应用,为研究者提供‘效率蓝图’。

深度学习自然语言处理
算法论文8

伯克利斯坦福联手造出「科研预言家」:77%准确率押注研究想法前景

伯克利和斯坦福团队让GPT - 4.1变身「科研预言家」,从顶会提取想法对比案例训练,不借助实验验证,靠推理押注。其在公开题库测试、人类专家团战等测试中表现出色,还能预测AI新点子。

深度学习自然语言处理
产品应用7

规模化人工判断:Dropbox 如何借助大语言模型优化 RAG 系统标注

为提升 Dropbox Dash 生成回复的相关性,工程师采用大语言模型辅助人工标注。该方案解决了纯人工标注的局限,通过人工校准大语言模型标注的方法,为 RAG 系统提供了有价值参考。

InfoQ
算法论文8

模型合体!上交&上海AI Lab&华师提出LED-Merging,拒绝「能力」与「安全」二选一

上海人工智能实验室等团队提出LED - Merging解决模型融合“安全 - 效用冲突”问题。该方法无需训练,像“神经元手术刀”,不牺牲专业能力还提升安全性,论文已被ACL 2025 Main Conference接收。

深度学习自然语言处理
新闻资讯8

让AI学会潜意识推理,Sapient发布类脑模型HRM

新加坡初创公司Sapient Intelligence发布仅2700万参数的分层推理模型HRM,在多项高难度推理任务上超越大模型。它绕过大模型推理困境,借鉴大脑机制,训练效率高,开源GitHub星标突破10.3k。

AIGC开放社区
算法论文8

14B检索能力超过Google Search,阿里ZeroSearch通过RL激发LLM检索推理能力~

有效信息搜索对提升LLMs推理和生成能力重要,当前RL方法有文档质量不可控和API成本高问题。阿里通义Lab提出ZEROSEARCH框架,经多步骤训练,实验显示其在检索能力和泛化性上表现出色。

PaperAgent
算法论文8

从打分器到思考者:RM-R1用推理重塑模型价值判断

伊利诺伊大学香槟分校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在多基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。

机器之心