「预训练框架」共找到 3482 篇相关文章
BigBang-Proton: 自回归基座模型统一语言、科学和物质世界
超对称公司发布新版基座模型 BigBang - Proton,实现多学科问题与 LLM 统一预训练和推理,挑战主流 AGI 技术路线。它有三项创新,在多专业学科任务表现出色,还提出宇宙尺度压缩构想。
震撼实锤!清华姚班校友揭「1.4×加速」陷阱:AI优化器为何名不符实?
为降低大模型预训练成本,近年新优化器频出,宣称加速1.4×到2×却难落地。斯坦福研究指出方法学缺陷,对比不同缩放范式加速差异,给出优化器设计见解,证实严格基准评测必要。
清华团队开源发布首个结构化数据通用大模型
2025年8月29日,清华崔鹏教授团队联合稳准智能开源“极数”(Limi X)结构化数据通用大模型。它融合结构因果推断与预训练技术,适配多任务,性能超最优专用模型,已落地多个工业场景。
从BERT到T5再到Qwen3:关于Embedding的八点总结
哈工大30+页综述聚焦通用文本嵌入(GPTE),系统介绍其架构、数据、模型,探讨预训练语言模型(PLM)给GPTE带来的基础能力与高级扩展,还涉及多模态、多语言、代码嵌入等应用。
基于闪电注意力机制,创新高效开源大模型
传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。
华为多路径推理破解大模型数学瓶颈,准确率超97%|ICML 2025
大模型处理复杂问题常“翻车”,华为诺亚方舟实验室提出思维森林(FoT)框架,借鉴人类认知方式,打破线性推理范式。FoT在多个数学推理任务表现出色,准确率超先进模型,将在ICML 2025开源。
最大的开源GraphRag:知识图谱完全自主构建|港科大&华为
香港科技大学KnowComp实验室与香港华为理论部提出AutoSchemaKG框架,可自主构建知识图谱,无需预定义模式。该系统利用大模型提取知识三元组并归纳模式,构建了ATLAS系列知识图谱,经测试表现优异。
CVPR 2025 | SketchVideo让手绘动起来,视频生成进入线稿时代
中国科学院大学等团队提出基于线稿的可控视频生成和编辑方法SketchVideo,发表于CVPR 2025。它基于预训练模型添加线稿控制网络,解决现有视频生成模型可控性等问题,实现高质量视频生成与编辑。
Qwen3.7:智能体新前沿
阿里云正式发布面向智能体时代的Qwen3.7-Max模型,将通过API提供服务。它能力全面,编程、办公、长周期执行等表现出色,适配多框架,在多场景评测中领先,能驱动生产力跃升,还经多实战测试验证实力。
赌自己会失业!田渊栋八人天团狂揽44亿元,杀入「递归进化」赛道
Recursive Superintelligence由八位顶尖AI研究员创立,获GV、英伟达等投资6.5亿美元。他们要让AI自我训练,实现递归自我进化,若成功或使AI研究员岗位消失。此前已有相关成果,产品端Anthropic也在推进AI主动性。