「少样本训练」共找到 2463 篇相关文章
谷歌的DeepSeek时刻:LLM推理加速被干到了8倍
谷歌TurboQuant论文介绍量化算法,能为大语言模型和向量搜索引擎大规模压缩。可将大语言模型KV缓存内存减至少6倍、加速达8倍且精度零损失,还介绍其工作原理及实验结果。
刚刚,GPT-5.4 发布,百万上下文、最强全能模型
OpenAI发布GPT - 5.4,集推理、编程等能力于一体,支持百万级上下文窗口。有三个版本,功能全面升级,如支持中途打断、电脑操作、视觉能力提升等,还更省token、少幻觉,安全机制完善,价格有调整。
马斯克点火全球最大超算,首个1GW狂飙奇点!6万亿Grok 5在训
马斯克官宣全球首个吉瓦级超算Colossus 2上线,狂堆55万块GPU,目标百万。下一代Grok 5已在训练,6万亿参数将引爆智能奇点。同时,全球AI巨头掀起算力军备赛,但美国面临电力短缺难题。
一个模型统一4D世界生成与重建,港科大One4D框架来了
港科大研究团队提出 One4D 框架,可统一 4D 生成与重建,构造同步输出多模态的视频扩散模型,支持多种任务形态。其有 DLC、UMC 等亮点,用合成与真实数据混合策略训练,实验表现佳。
TinyAI :全栈式轻量级 AI 框架
TinyAI是用Java实现的全栈轻量级AI框架,具有教育友好、模块化等特点。它分层设计,涵盖数学运算、神经网络等模块,支持多种模型架构与并行训练,还有智能体系统,可用于多领域,未来规划丰富。
快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!
快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。
一种基于滑动层合并的高效深度修剪大模型的方法
文章指出深度修剪可加快推理速度,但直接丢层会降低性能。为此提出滑动层合并法,根据相似度阈值融合连续层,简化结构且保持性能。实验显示该方法优于现有技术,还揭示了与宽度修剪结合的潜力。
杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切争议
上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,引发广泛关注。今日凌晨,杨植麟等团队成员在 Reddit 开展 AMA 活动,回应 K2 Thinking 相关问题,如 KDA 机制应用、训练成本、速度与准确性平衡等。
OpenAI最强对手出现!马斯克发布Grok-4,性能碾压Claude 4两倍!
半小时前马斯克发布Grok - 4,虽Grok3.5跳票、直播迟到被吐槽,但它训练量和算力投入大。在多项基准测试中碾压Claude Opus 4,还具备原生工具调用等能力,xAI目标是让其更快更智能。
边画边想!多模态Reasoning迎来巨大提升!
论文指出文本无法精准表达空间关系,现有视觉语言模型(LVLM)在空间推理上是短板。ViLaSR让模型直接画图推理,经三阶段训练,在五大空间推理测试中表现出色,还开源资源,有望带来机器认知升维。