无预训练模型」共找到 8413 篇相关文章

推荐文章7

200行python代码实现从Bigram模型到LLM

本文从`babygpt_v1.py`出发,逐步加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、单头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。

阿里云开发者
算法论文8

碾压π0.5,复旦团队首创「世界模型+具身训练+强化学习」闭环框架

复旦团队针对当前 VLA 策略依赖模仿学习、真实机器人在线 RL 成本高、传统物理仿真器有局限等问题,提出 ProphRL 框架。该框架以世界模型 Prophet 为核心,结合 RL 算法,为具身智能落地提供更可行路径,实验效果显著。

机器之心
推荐文章7

模型评估排障指南 | 关于 LaTeX 公式解析

这是大模型评估排障指南系列第二篇,聚焦 LaTeX 公式解析。评估难点是解析和比较模型输出与标准答案,标准方法。lm - evaluation 框架用 sympy 解析准确率约 0.94,还给出缓解问题办法。

Hugging Face
算法论文7

最新发现!每参数3.6比特,语言模型最多能记住这么多

Meta、DeepMind等团队研究语言模型记忆容量,提出新方法估计模型对数据点的‘了解’程度,发现GPT系列模型约每个参数3.6比特,还提出模型容量等相关定律,激发社区多方面思考。

机器之心
新闻资讯7

GPT-5-Thinking新训练方法公开:让AI学会忏悔

OpenAI提出忏悔训练Confessions,让ChatGPT自己“坦白从宽”。在GPT - 5 - Thinking上实验有效,模型犯错后多会坦白,且更诚实,不影响原任务表现。还介绍了训练方法、实验结果及局限性。

量子位
算法论文8

训练数据枯竭怎么办?首篇「数据价值密度」综述理清思路

上海交通大学与上海人工智能实验室团队发布首篇「数据价值密度」综述。提出“数据价值密度”概念并定义,建立分类框架梳理现有工作,还指出该领域面临的挑战,为大模型训练提供指南。

机器之心
新闻资讯8

英伟达Jim Fan:「世界建模」是新一代预训练范式

英伟达机器人主管Jim Fan判断,继“下一个词预测”后,世界建模将成新预训练范式,2026年大世界模型将为多模态AI奠基。他还讨论世界模型定义、应用,展望新推理形式,业内人士也各抒己见。

量子位
开源动态8

南洋理工、北大、上海AI实验室开源长记忆世界模型

目前世界模型模拟方法在维持长期一致性上有挑战,南洋理工大学、北京大学王选计算机技术研究所、上海人工智能实验室联合开源长记忆世界模型WORLDMEM,介绍了其记忆机制、基础架构、训练技术及检索策略等。

AIGC开放社区
算法论文8

解决扩散模型过拟合的创新框架T-LoRA

训练大型文本到图像扩散模型定制化时,样本有限易致过拟合。AIRI和HSE大学团队提出T - LoRA框架,动态调整训练能力、用正交初始化,实验显示其在单图像和多图像任务表现优,用户更偏好其生成图像。

AIGC开放社区
开源动态8

腾讯开源WMT2025冠军大模型:拿下30个第一,同类最佳

昨晚腾讯开源WMT2025冠军翻译大模型Hunyuan - MT - 7B,它在31种语言测试中获30个第一,成同类最佳。文中介绍其架构、训练过程,还通过多场景翻译案例展现优势,有望推动高质量翻译普及。

AIGC开放社区