「数据中心动态训练」共找到 2592 篇相关文章
Mira翁荔陈丹琦公司,让老黄掏出了600亿美金
Thinking Machines Lab官宣与英伟达达成新一轮合作,将落地预计成本600亿美元的1GW规模数据中心,含英伟达现金注资。此前英伟达已参与其种子轮融资助其达120亿美元估值,现公司估值达500亿美元。
深入感知级别图像理解:UniPercept 统一图像美学、质量与结构纹理感知
多模态大语言模型在语义级任务表现卓越,但在感知级图像理解有短板。上海人工智能实验室等机构联合发布 UniPercept,构建感知属性定义系统与基准测试集,训练强基准模型,在多方面表现超现有顶尖模型,应用潜力大。
视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理
快手开源能看懂视频并跨模态推理的大模型Keye-VL 1.5,其有时序定位、描述和推理能力,跑分领先。采用三段式架构和Slow-Fast编码策略,经四阶段预训练和多阶段后处理,团队成果多,推动多模态技术落地。
机器人视觉语言导航进入R1时代!港大联合上海AI Lab提出全新具身智能框架
香港大学与上海AI Lab联合提出VLN - R1,可将自然语言指令转化为连续导航动作,打破传统链条。它有两阶段训练等创新支柱,在测试中表现出色,小模型性能佳,推动具身智能从数字向具身认知跨越。
独家|能量桥完成新⼀轮融资,Monolith领投,中科创星跟投
近日,能量桥完成新一轮融资,由 Monolith 砺思资本领投,中科创星跟投。该公司核心团队经验丰富,其预制化超导能源模块可实现数据中心配电零损耗。在 AI 算力建设背景下,超导技术或成输电破局点。
NeurIPS 2025 | 中科大、港中深、通义千问联合发布CoRT:仅30个样本教会大模型高效推理,token消耗降低50%
大型推理模型在精确数学计算上存在问题,如认知冲突、行为低效、数据稀缺。中科大、港中深、通义千问联合推出CoRT框架,用创新数据合成与多阶段训练,提升模型推理能力和效率,成果已开源。
NeurIPS 2025 Spotlight | 让检索、推理真正「合体」的小而强模型,AceSearcher来了
近期,多所高校研究团队发布 AceSearcher 模型,它是让同一语言模型在推理时兼任双角色的合作式自博弈框架,以两阶段训练为骨架,将推理与检索结合,提升复杂检索任务效果,在多任务上表现出色。
新易盛:国产光模块巨头发展史
文章讲述新易盛发展历程,从成立初聚焦电信光模块,后拓展数据中心业务,推出多款产品打入国际供应链。2024年借AI东风业绩大增,但实控人违规减持、财务压力大,1.6T研发落后,未来发展待察。
AI里最大的Bug,却也是人类文明最伟大的起点。
OpenAI论文指出AI产生幻觉是因其训练方式奖励瞎蒙行为。以考试为例,AI在信息不足时猜测是最优策略。还从统计学解释根源,指出解决幻觉需改变评估指标,也引发对人类想象力起源的思考。
24张图,从GPT-2到gpt-oss,看OpenAI开源模型技术演进
2025年8月OpenAI释出gpt-oss-20b与gpt-oss-120b两个开源权重模型。文章梳理了从GPT - 2到gpt - oss的技术演进,拆解关键创新点,对比了与Qwen3的差异,介绍训练推理细节、实测体验及与GPT - 5跑分对比情况。