大模型训练」共找到 9479 篇相关文章

新闻资讯7

「AI模型时代的CIO」云栖专场: AI实战者与落地破局者的坦白局

云栖会「AI模型时代的CIO」专场,探讨企业AI落地难题。虽搭上AI电梯是趋势,但企业落地有不确定性,如组织架构不匹配等。多位实战者分享经验,给出RIDE等解法,助企业破局。

阿里云开发者
开源动态7

20人团队提前实现DeepSeek构想,AI算力变天?直击模型算力成本痛点

国内20人玉盘AI团队推出SRDA全新计算架构方案,试图从硬件源头解决当前AI算力核心瓶颈。该架构有诸多创新设计,能应对模型训推痛点,与DeepSeek构想契合,或成模型专用架构分水岭。

新智元
8

重磅发现!模型的「aha moment」不是装腔作势,内部信息量暴增数倍!

中国人民学等联合团队研究发现,模型推理有“信息脉冲”,特定步骤互信息值飙升形成“互信息峰值”,对应“思考词汇”。基于此提出无需额外训练提升推理性能的方法,代码已开源。

机器之心
算法论文8

天下苦VAE久矣:阿里高德提出像素空间生成模型训练范式, 彻底告别VAE依赖

当前主流图像生成技术训练范式依赖VAE,带来训练复杂、微调成本高的问题。阿里高德提出EPG,结合自监督预训练与端到端微调,去除对VAE依赖,在训练效率和生成效果上有突破。

量子位
算法论文8

语言模型离“数学证明高手”还有多远?斯坦福、伯克利、MIT 团队提出 IneqMath 评测标准

现在很多语言模型常给出看似正确的结论,但推理过程却有问题。斯坦福、伯克利和MIT团队提出新思路,构建IneqMath数据集及‘AI数学裁判系统’,研究发现很多模型推理不严谨,还给出两个提升准确率的办法。

AI前线
开源动态8

以小博!Nanbeige4-3B重磅开源:硬刚Qwen3,挑战小模型能力新高度

近年来语言模型参数膨胀,成本升高,业界重注小语言模型。近日,Boss直聘南北阁模型实验室发布仅30亿参数的Nanbeige4 - 3B,在多方面媲美甚至超越通义千问Qwen3系列模型,开源印证小模型潜力。

AIGC开放社区
产品应用8

比肩Claude Opus:阶跃星辰最强模型Step 3.5 Flash发布

阶跃星辰发布最强模型 Step 3.5 Flash,参数强,性能与前沿顶级模型并驾齐驱。其架构平衡算力与智力,有独特注意力布局;基础设施保障训练稳定;强化学习激发智能体潜能;评测数据显示战斗力强,未来还将持续优化。

AIGC开放社区
产品应用8

SDD-RIPER 团队落地指南:如何让整个团队在一周内跑通模型编程

文章提供了 SDD - RIPER 团队落地方案,能让团队一周内跑通模型编程,质量可控、效果可量化。阐述了推不动模型编程的痛点及 SDD - RIPER 的解决办法,介绍了部署、实操流程和试点 SOP,还给出效果数据与常见问题解答。

阿里云开发者
产品应用8

中国电信天翼AI发布首款AI眼镜,星辰模型开启第一视角智能交互新时代

在2025世界人工智能会上,中国电信天翼AI发布全球首款融合自研“星辰模型”的智能穿戴设备——天翼AI智能眼镜,依托云网融合与星辰模型,开创第一视角智能交互新范式。

AI科技评论
算法论文8

字节&MAP重塑模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限

强化学习虽提升语言模型表现,但面临探索难题。字节跳动等团队提出FR3E框架,分两阶段重建探索机制,在多数学推理基准实验中显著优于强基线,为模型强化学习提供新范式。

量子位