「大模型训练」共找到 9676 篇相关文章

新闻资讯8

刚刚,Jev全网解禁!1.2亿Token限时免费用

本文报道TypeSafe AI旗下专做结构化决策判断的AI模型Jev全网解禁,开放所有用户直接使用,新用户赠送1.2亿Token额度且输出免费,Jev配合大模型的玩法引发全球开发者热潮,展示了多个实用落地场景。

新智元
产品应用8

10亿国民App丝滑升级AI应用!高德携手通义重构的底层架构曝光

高德用AI重构底层技术栈,建立主 - 从Agent架构,将千问大模型与空间智能结合。新架构分Agent层、模型层和工具层,还依托生态数据和通信协议。这让高德从工具变智能体,为行业转型提供范式。

量子位
开源动态8

通过零开销逐层权重卸载技术将SGLang Diffusion wan2.2的推理速度加速60%

文章介绍在优化SGLang对Wan2.2视频生成模型支持时,发现双Transformer架构下第1步和第19步推理慢的问题。通过零开销逐层权重卸载技术,将整体推理速度提升60%,还突破显存墙,且该优化可扩展到其他模型。

GiantPandaLLM
新闻资讯8

干货满载!腾讯云AI技术周圆满收官,回顾如何利用AI增效创收

2025腾讯全球数字生态大会启幕前夕,腾讯云联合InfoQ打造「AI技术周」,9月8 - 14日直播输出,围绕多关键议题邀大咖对话,公布多项AI+产品进展,涵盖降成本搭应用、AI Agent落地、数据库智能进化等内容。

InfoQ
算法论文8

欲取代transformer的SSA(次平方稀疏注意力)解读

文章解读了欲取代Transformer的SSA(次平方稀疏注意力)算法。它支持12M tokens上下文,比fastAttention快52倍,训练和推理更快。SSA改变了注意力扩展特性,有计算和内存线性扩展等特性,经三阶段训练可可靠利用长上下文。

Agent的潜意识
算法论文8

破解AI对不同上下⽂位置的敏感度不⼀致,新框架使出“解铃还须系铃人”

语言模型存在位置偏见,影响复杂推理等任务。论文提出Pos2Distill框架,将模型优势位置能力迁移到劣势位置缓解偏差,设计了Pos2Distill - R1和Pos2Distill - R2,在检索和推理任务表现好且有跨任务泛化能力。

量子位
新闻资讯8

LeCun炮轰Hinton:他认可LLM就是想摆烂退休了!

Yann LeCun在播客专访中火力全开,炮轰Hinton认可LLM是想摆烂退休,直言LLM不是通往智能的路,还吐槽Meta卷入LLM竞赛后无法专注研究。他介绍了新公司AMI和世界模型、JEPA等技术,认为JEPA类世界模型五年内将统治AI圈。

量子位
开源动态8

小扎万字檄文炮轰硅谷,Meta重磅开源30B小钢炮!一台MacBook就能跑

Meta发布全新30B大模型Muse Glimmer并开源,用4-bit量化等技术让其能在本地设备运行,有五大核心超能力且采用Apache 2.0协议。同时,Meta CEO小扎发表万字檄文暗讽OpenAI等,抨击AI末日论等观点。

新智元
产品应用8

九章云极发布AI工厂体系:破解140万亿Token时代的落地悖论|甲子光年

九章云极于6月17日发布Alaya NeW AI工厂体系,锚定十万P算力、十万亿Token、千个模型、千倍降本四大目标。该体系是智能工业化的必然产物,能解决资源难转生产力的难题,还具备技术效能、生态范式和商业飞轮三大支柱。

甲子光年
开源动态7

多模态需求井喷,智能视频云如何靠分布式处理破局?

国内多模态AI发展中,模型层火热但应用层落地慢。多模态应用落地面临体验升级、视频化扩展、大模型部署下沉挑战,催生智能视频云升级需求。火山引擎在FORCE大会展示分布式多媒体处理实践,推出MIPP平台,未来将开源并推商业化产品。

InfoQ