自训练」共找到 3002 篇相关文章

算法论文8

比Transformer更强的架构来了?浙大新作Translution,一统卷积和注意力

随着大模型发展遇瓶颈,浙大等校学者提出神经网络基础操作Translution,实现注意力与卷积的融合统一,构建更普适神经计算机制。它性能超Self - attention,为新一代神经网络发展开辟新方向。

新智元
开源动态8

英伟达&MIT等推出Long-RL,长视频训练速度翻倍

英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。

机器之心
开源动态8

刚刚,智谱和华为搞波大的:中国首个国产芯片训练出的SOTA多模态模型!

智谱与华为合作开源新一代图像生成模型GLM-Image,是中国首个全程用国产芯片训练的SOTA多模态模型,擅长文字渲染,拿下多项榜单第一,API调用一张图只要0.1元,还解析了其技术架构。

量子位
开源动态8

无需训练,即插即用:西湖大学发布世界模型WorldForge,让普通视频模型秒变「世界引擎」

Sora亮相,AI视频可控性成瓶颈。西湖大学AGI实验室团队提出WorldForge框架,在推理时为视频模型注入「时空几何」,无需训练,实现单图360°环绕视频生成和视频重运镜等,降低创作门槛。

机器之心
算法论文8

Agent-World:扩展真实世界环境,让智能体与环境协同进化!

文章提出Agent-World,将“智能体环境探索”与“进化训练”结合,构建了1978个环境、19822个工具。实验表明,其在23个基准上一致性优于先进方法与强开源基础模型,还分析了环境规模与进化对性能的影响。

机器之心
算法论文7

token危机解决?扩散模型数据潜力3倍于回归,重训480次性能仍攀升

新加坡国立大学AI研究者Jinjie Ni团队预训练扩散语言模型(DLMs)与回归(AR)模型,发现DLMs是超强数据学习者,数据潜力超AR 3倍,重训480次性能仍攀升,还剖析同期研究方法论缺陷。

机器之心
算法论文8

奖励模型终于迎来预训练新时代!上海AI Lab、复旦POLAR,开启Scaling新范式

在大语言模型后训练阶段,奖励模型设计与训练是关键瓶颈。上海AI Lab、复旦推出预训练奖励模型POLAR,采用策略判别学习新范式,适配强化微调,性能和泛化能力强,为LLM后训练带来新可能。

机器之心
新闻资讯8

杨植麟回复:Kimi K2训练用的H800!但“只花了460万美元”嘛…

月之暗面团队回应Kimi K2 Thinking训练成本,透露用英伟达H800,GPU少但利用充分。该模型凭实力与低成本引迁移潮,还引发对闭源巨头估值反思。技术上有优化创新,团队还公开答疑。

量子位
算法论文8

大模型如何泛化出多智能体推理能力?清华提出策略游戏博弈方案MARSHAL

近日,清华大学等机构研究团队提出 MARSHAL 框架,利用强化学习让大模型在策略游戏博弈。实验表明,多轮、多智能体训练提升了模型博弈决策水平,将推理能力泛化到通用多智能体系统,在一般推理任务表现显著提升。

机器之心
新闻资讯7

21 页 PDF 实锤 Grok 3“套壳”Claude?Grok 3 玩曝,xAI工程师被喷无能!

网友 GpsTracker 爆料,xAI 公司的 Grok 3 在“思考模式”下称是 Anthropic 公司的 Claude 3.5。多种模式测试显示异常回应仅在“思考模式”触发,21 页 PDF 记录也证实其“曝”。此事引发热议,有人吐槽预训练团队水平差。

AI前线