「训练机制」共找到 2825 篇相关文章
伯克利斯坦福联手造出「科研预言家」:77%准确率押注研究想法前景
伯克利和斯坦福团队让GPT - 4.1变身「科研预言家」,从顶会提取想法对比案例训练,不借助实验验证,靠推理押注。其在公开题库测试、人类专家团战等测试中表现出色,还能预测AI新点子。
阿里通义的视觉RAG革命!VRAG-RL:基于强化学习的视觉感知RAG框架,性能飙升30%
阿里巴巴通义实验室推出VRAG - RL,融合视觉感知、多模态推理与强化学习,已在GitHub开源。它破解传统RAG处理视觉数据难题,通过创新机制提升性能,在多数据集表现出色,还将向更拟人化和低幻觉方向发展。
突发!卡帕西官宣加入Anthropic,OpenAI对家挤满了前员工
安德烈·卡帕西宣布加入 Anthropic,负责 Claude 模型大规模训练。他是知名 AI 研究者,曾任职 OpenAI、特斯拉等。此前 AI 人才争夺 Meta 和 OpenAI 是主角,Anthropic 闷声吸纳了卡帕西,OpenAI 联合创始团队成员多有流失。
GPT-5系列咋都爱说「哥布林」?原因找到了
OpenAI发布博客解释模型迷上「哥布林」的原因。原来是训练“Nerdy”人格时,奖励信号偏爱怪物词汇,强化学习将风格固化并扩散到普通对话。此前DeepSeek V3.1也出现过「极」字Bug。
跳出「黑盒」,人大刘勇团队最新大语言模型理论与机理综述
大语言模型工程成功但理论研究滞后,被视为「黑盒」。人大刘勇团队用生命周期分类法,将LLM理论研究整合为六阶段,系统综述底层理论与机制,指出前沿挑战,为其向严谨科学转型提供路线图。
60秒极限挑战!中国GPU独角兽杀出重围,斩获图形顶会大奖
2025年12月,SIGGRAPH Asia 2025在香港开幕,摩尔线程在3DGS重建挑战赛中凭自研技术LiteGS斩获银奖。该团队还开源3DGS基础库LiteGS,实现全链路协同优化,提升训练效率与重建质量。
ReAct范式深度解析:从理论到LangGraph实践
文章深度解析ReAct范式,从理论出发,介绍其原理及解决的传统AI问题。分析LangGraph中ReAct实现机制,结合智能解决方案系统案例展示应用价值,还给出手写实践及使用ReAct范式的总结建议。
高性能全闪并行文件系统的设计和实践
焱融科技 CTO 张文涛在 QCon 大会分享‘高性能全闪并行文件系统的设计和实践’,介绍了焱融全闪文件存储架构和 YRCloudFile 技术细节,分享其解决 AI 训练存储难题的方案。
Anthropic逃过一劫:成功和解万亿美元版权诉讼,避免破产
Anthropic与作者达成和解,避开12月审判和可能高达万亿的赔偿。此前法官裁定其用盗版内容训练模型属盗版行为。和解为行业划红线,数据需明确来源授权,Anthropic仍面临其他版权挑战。
大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO
本文介绍了大型语言模型稳定强化学习新路径——几何平均策略优化GMPO。它是GRPO稳定化版本,通过优化几何平均替代算术平均,解决GRPO训练不稳定问题,在多任务实验中显著优于GRPO。