LLM训练」共找到 2867 篇相关文章

新闻资讯7

全国首部“高质量数据集验收”标准,现公开征集起草单位和专家!

国家数据局等明确支持数据流通服务机构与人工智能企业合作,凸显数据到模型训练与产业应用环节的重要性。现有数据质量标准在产业场景有缺口,全国首部《人工智能训练数据集交付与质量验收规范》团体标准应运而生,现征集起草单位和专家。

AI大模型应用实践
新闻资讯8

LeCun离职前的吐槽太猛了

年底将离开Meta的LeCun在播客直言,不看好大语言模型通往AGI,也吐槽Meta封闭。他将创办开源公司AMI研究世界模型,认为其与LLM本质不同,还回顾AI学习史引出JEPA架构。

量子位
推荐文章8

NVIDIA技术沙龙《强化学习流水线优化:性能分析与 Rollout加速》演讲笔记

该演讲笔记围绕强化学习流水线优化,强调用Nsight Systems做性能分析,介绍在Ray Actor添加参数及解读文件方法。给出训练/生成参数优化技巧,如Actor训练和Rollout优化,还以Qwen 2.5 7B等模型为例总结参数调优经验。

GiantPandaLLM
算法论文8

解决扩散模型过拟合的创新框架T-LoRA

训练大型文本到图像扩散模型定制化时,样本有限易致过拟合。AIRI和HSE大学团队提出T - LoRA框架,动态调整训练能力、用正交初始化,实验显示其在单图像和多图像任务表现优,用户更偏好其生成图像。

AIGC开放社区
新闻资讯7

5个月估值翻10倍,AI数据赛道跑出一家新独角兽

成立约18个月的AI训练数据公司AfterQuery正筹新一轮融资,估值达32亿美元,5个月涨超10倍。它最初想开发AI智能体,后转收集训练材料。此赛道已有多家高估值公司,且数据隐私和安全风险待解。

DeepTech深科技
开源动态8

Qwen3技术报告首次全公开!“混合推理模型”是这样炼成的

本文首次公开Qwen3技术报告,介绍其模型架构、预训练及后训练过程、性能表现等技术细节。Qwen3整合两种模式,引入思考预算机制,降低轻量级模型计算资源,在多基准测试领先,多语言支持扩展至119种,所有模型开源。

通义千问Qwen
算法论文8

Test Time Scaling Law远未达到上限! o4-mini仅15.8%通过率,华为诺亚提出代码HLCE终极基准

华为诺亚研究员推出全新编程基准HLCE,含235道竞赛难题。实验显示,顶级LLM在该基准表现不佳,推理模型优势大,IOI交互式题难攻克。研究还发现模型自我认知与推理能力发展不同步,Test Time Scaling Law远未达上限。

机器之心
新闻资讯7

GPT之父:只用上世纪数据训AI,它居然也会写Python?!

GPT之父Alec Radford团队训练出talkie - 1930 - 13b模型,其训练数据截止1931年。该模型能说新政立法、写Python代码。团队还对比其与现代模型,发现核心能力差距不大,且用老语料调教它成聊天助手时现风格问题。

量子位
算法论文8

欲取代transformer的SSA(次平方稀疏注意力)解读

文章解读了欲取代Transformer的SSA(次平方稀疏注意力)算法。它支持12M tokens上下文,比fastAttention快52倍,训练和推理更快。SSA改变了注意力扩展特性,有计算和内存线性扩展等特性,经三阶段训练可可靠利用长上下文。

Agent的潜意识
算法论文8

挑战 1 比特!ETH Zürich 秦浩桐:如何把大模型「塞进」小设备?| IJCAI 2026

IJCAI 2026大会上,秦浩桐给出创新解法,挑战无需重训的“后训练量化”极限,将庞大的LLM强行压缩至极端的1比特与2比特。其团队的BiLLM与SqueezeLLM打破了后训练量化魔咒,还指出极低比特量化的三大挑战。

AI科技评论