弹性预训练」共找到 2216 篇相关文章

算法论文8

开放世界任务成功率82%!美的攻克机器人泛化控制难题

美的AI研究院和华东师范大学联合提出ChatVLA - 2模型,引入动态混合专家架构和双阶段训练流程。真机实验显示其开放世界任务成功率达82%,远超现有方法,为通用机器人控制提供新思路。

量子位
产品应用8

超脑未来WorldDreamer V4横扫多个权威榜单,世界模型进入群体智能时代

超脑未来发布 WorldDreamer V4,它以多智能体为基本单位,具多种核心能力。采用新训练架构,引入 Masked Agent Modeling,用共享隐式世界状态带来新协同范式,还在多权威榜单领先。

机器之心
新闻资讯7

算力极限下,OpenAI 急着做什么?

OpenAI联合创始人兼总裁Greg Brockman接受专访,就产品战略收拢、新基座模型Spud等议题给出内部判断,回应业界质疑。他称产品调整是算力硬约束下的优先级排序,还透露了产品核心方向和Spud进展。

机器之心
新闻资讯7

想进OpenAI?先解出这道题,百万美元算力已就位

OpenAI发起Model Craft Challenge「Parameter Golf」项目,要求在固定数据集上降验证损失,模型产物控制在16MB内,8张H100 GPU 10分钟完成训练。提供百万美元算力,6月招早期人才,挑战3月18日至4月30日。

机器之心
开源动态8

3A大作!阿里ROLL团队从基建->算法->机理,推动RL4LLM全栈协同优化

阿里巴巴ROLL团队联合高校推出「3A」协同优化框架,推动「强化学习用于大语言模型(RL4LLM)」迈向新范式。Async架构提升GPU利用率,AsyPPO降低计算资源消耗,Attention机制提升训练效率与可解释性。

机器之心
开源动态8

BigBang-Proton: 自回归基座模型统一语言、科学和物质世界

超对称公司发布新版基座模型 BigBang - Proton,实现多学科问题与 LLM 统一训练和推理,挑战主流 AGI 技术路线。它有三项创新,在多专业学科任务表现出色,还提出宇宙尺度压缩构想。

InfoQ
算法论文7

震撼实锤!清华姚班校友揭「1.4×加速」陷阱:AI优化器为何名不符实?

为降低大模型训练成本,近年新优化器频出,宣称加速1.4×到2×却难落地。斯坦福研究指出方法学缺陷,对比不同缩放范式加速差异,给出优化器设计见解,证实严格基准评测必要。

新智元
开源动态8

清华团队开源发布首个结构化数据通用大模型

2025年8月29日,清华崔鹏教授团队联合稳准智能开源“极数”(Limi X)结构化数据通用大模型。它融合结构因果推断与训练技术,适配多任务,性能超最优专用模型,已落地多个工业场景。

AI科技评论
算法论文7

从BERT到T5再到Qwen3:关于Embedding的八点总结

哈工大30+页综述聚焦通用文本嵌入(GPTE),系统介绍其架构、数据、模型,探讨训练语言模型(PLM)给GPTE带来的基础能力与高级扩展,还涉及多模态、多语言、代码嵌入等应用。

PaperAgent
算法论文8

CVPR 2025 | SketchVideo让手绘动起来,视频生成进入线稿时代

中国科学院大学等团队提出基于线稿的可控视频生成和编辑方法SketchVideo,发表于CVPR 2025。它基于训练模型添加线稿控制网络,解决现有视频生成模型可控性等问题,实现高质量视频生成与编辑。

机器之心