RL训练方法」共找到 3361 篇相关文章

新闻资讯8

谷歌用Gemini 3同时革了OpenAI和英伟达两家的命

谷歌发布Gemini 3全家桶,打断英伟达和OpenAI双赢美梦。它实现原生多模态,对OpenAI构成代际优势;用TPU训练模型,摆脱CUDA依赖,冲击英伟达算力神坛。谷歌全栈自研,其发展或改变AI格局。

新智元
推荐文章7

AI时代,为什么你又焦虑又学不进去?这个人破解了专注力的秘密

文章指出AI时代人们学不进去,原因在于信息爆炸、AI工具易致分心,本质是没学会处理学习不适。介绍了Time Boxing、“10分钟法则”等应对方法,强调专注力是新学习力,要预先规划建立学习系统。

花叔
新闻资讯7

号称最道德的AI公司,却靠盗版书喂大脑,结局赔了15亿刀:Anthropic CEO小传

文章讲述Anthropic CEO Dario Amodei的故事。他曾因担忧GPT-2风险离开OpenAI创立Anthropic,获有效利他主义者资助。Claude研发慢错过市场,后求立法监管对手,还因用盗版书训练模型被告,赔15亿刀。

AI寒武纪
开源动态7

NextStep-1:一次在图像生成上自回归范式的探索

阶跃星辰团队探索自回归图像生成新路径,推出 NextStep-1。它直接在连续视觉空间自回归生成,架构简洁,实现端到端训练。模型有高保真生成和编辑能力,Benchmark 表现佳,但也面临稳定性等挑战。

机器之心
开源动态8

GLM4.5之后,智谱又开源GLM-4.5V,实测下来视觉推理能力贼强~

智谱继GLM4.5后又开源GLM - 4.5V,它是同级别开源SOTA视觉推理模型,在多模态理解榜单表现优异。文章实测其在科研全生命周期的应用,还介绍了模型架构设计和训练策略。

PaperAgent
算法论文8

微调重要表征以增强思维链的推理能力

团队提出关键表征微调(CRFT)方法,通过信息流分析识别和优化关键表征。在八个数学和常识推理基准及两个模型系列验证其有效性,能提高推理准确率,学习参数量低,还适应少样本场景。

深度学习自然语言处理
算法论文8

ICML 2025 | 给AI装上「智能升级插件」!阿里安全-清华大学D-MoLE让模型在持续学习中动态进化

近日,阿里巴巴集团安全部 - 交互内容安全团队与清华大学联合研究成果被 ICML 2025 收录。他们提出 D - MoLE 框架应对多模态大模型持续学习挑战,实验显示其性能优、训练快,还能用于提升阿里安全审核模型适应力。

机器之心
新闻资讯8

炸裂!Claude以第一作者写论文反驳苹果「推理模型根本没有推理能力」:苹果有三大错误

苹果论文称推理模型无推理能力,引发争议。Anthropic的Claude Opus以第一作者写论文反击,指出苹果研究有混淆‘推理失败’与‘输出截断’等三大问题,还通过实验证明模型能力,强调需更聪明评估方法

AI寒武纪
算法论文8

MIT & Google | 提出异步并行生成新范式,LLM推理效率大幅提升!

MIT与谷歌团队在研究PASTA中探索异步生成范式,开发标记语言PASTA - LANG,采用双阶段训练流程,设计推理系统。实验显示PASTA平衡性能与质量,有可扩展性,为LLM推理效率优化开创学习驱动新路径。

AINLPer
开源动态8

AI 领域新动向!持续思考模型CTM横空出世:AI 向生物智能迈出重要一步

Sakana AI 推出新型 AI 模型 CTM,重新引入「时间」和「神经元动态」到 AI 计算核心。它有诸多创新,在迷宫探索、图像识别等任务表现出色,虽有训练慢等不足,但为 AI 向生物智能迈进提供新思路。

AI寒武纪