「低成本训练」共找到 3874 篇相关文章
清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026
大语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为长上下文研究提供新思路。
美团智能体SOTA模型LongCat-Flash-Thinking-2601开源
美团龙猫团队开源智能体推理模型LongCat - Flash - Thinking - 2601,总参数5600亿。该模型在多方面有卓越表现,团队通过构建数据、模拟环境、采用强化学习策略及设计高效架构等,使其比肩闭源模型。
告别“一眼定生死”:Agent-as-a-Judge 开启 AI 评估的下半场
过去两年,LLM-as-a-Judge成评估界“黄金标准”,但面对复杂任务力不从心。论文《A Survey on Agent-as-a-Judge》指出,应从单一的大模型裁判进化为具备行动能力的智能体裁判,还阐述了其优势、发展阶段等。
认知重建:Speckit 用了三个月,我放弃了——走出工具很强但用不好的困境
本文作者分享使用 Speckit 三个月的踩坑经历,探讨 AI 编程工具落地难题。介绍复合工程与上下文工程理念,提出 AI 工程化方案,对比传统工具,阐述其设计、落地策略及未来趋势,助力解决企业开发痛点。
吴恩达年度AI总结来了!附带一份软件开发学习小tips
AI大神吴恩达总结2025热门AI趋势,包括模型推理成标配、Meta引发人才争夺战、数据中心火热、智能体编程重塑软件开发。还给出软件开发学习建议,如参加课程、动手实践、读论文。
老黄200亿「钞能力」回应谷歌:联手Groq,补上推理短板
谷歌TPU威胁刚至,英伟达砸200亿美元联手Groq布局AI新时代。知名投资人指出Groq LPU推理速度远超GPU、TPU等,但内存容量小。英伟达借此补推理短板,入局竞争激烈的推理市场。
摩尔线程算法一鸣惊人,图形学顶会夺银!已开源
12月17日,在SIGGRAPH Asia 2025上,摩尔线程凭借自研技术LiteGS在3DGS重建挑战赛中获银奖。3DGS是革命性3D场景表示与渲染技术,摩尔线程开源3DGS基础库LiteGS,实现全链路协同优化。
流式数据集:效率提升 100 倍!
现在只需一行代码,就能通过 `load_dataset('dataset', streaming=True)` 以流式方式加载数据集,无需下载。Hugging Face 优化后端,提升流式数据集速度与效率,减少请求、提升解析速度,还优化启动和流式加载阶段。
750篇论文,彻底把统一多模态模型摸清了
未来迈向AGI需多模态AI系统。南大等联合发表综述,涵盖754篇文献。分析传统路线痛点,介绍统一多模态模型定义、技术路线、训练方法等,还提及应用场景及未来方向。
谷歌:全栈AI之王
随着Gemini 3模型与第七代TPU的发布,谷歌打破OpenAI与英伟达主导的市场叙事。其全栈AI战略从底层基础设施到用户产品全覆盖,TPU进化、软硬件契合,吸引大客户,C端产品成发展引擎。