「视觉Token筛选」共找到 1338 篇相关文章
Mini-sglang-01:从Client到Scheduler的消息流转之旅
文章围绕轻量化大模型推理系统mini - sglang,详细介绍消息从客户端经APIServer、Tokenizer到Scheduler的流转过程,分析核心组件功能、消息体系、正反向链路及优化策略,还预告后续分析调度和模型实现逻辑。
大模型的第一性原理:(二)信号处理篇
本文从信号处理角度解读大模型原论文,探讨语义向量化原理,分析 Transformer 与 Granger 因果关系。指出大模型输入 Token 语义嵌入是将自然语言处理转化为信号处理问题,向量化与信号处理、信息论联系紧密。
GPT-5.2首发评测:大神深度体验两周,强到离谱,但慢得抓狂
为对抗谷歌的Gemini 3,OpenAI推出GPT - 5.2。大神Matt Shumer深度评测,指出其指令遵循、代码生成、视觉和长上下文等能力有提升,但速度慢。与Claude Opus 4.5、Gemini 3 Pro各有分工。
首帧的真正秘密被揭开了:视频生成模型竟然把它当成「记忆体」
UMD、USC、MIT研究团队发现视频生成模型会把首帧当作‘概念记忆体’,将视觉实体存于首帧并在后续复用。基于此提出轻量方法FFGo,用少量例子让模型实现SOTA级视频定制。
英伟达拿出推理版VLA:Alpamayo-R1让自动驾驶AI更会动脑子
当今自动驾驶模型虽强大,但在‘长尾场景’易翻车。英伟达推出的Alpamayo - R1是带推理能力的视觉 - 语言 - 行动模型,有核心创新,实验中性能显著提升,训练分三阶段,让自动驾驶迈向可解释。
探索文本压缩极限!C3纯文本压缩pipeline:20倍压缩解码准确率98%
DeepSeek团队的DeepSeek - OCR技术引发关注,研究者重新审视视觉压缩路径后提出C3技术。C3采用纯文本压缩管道,实验表明其压缩精度远超DeepSeek - OCR,还具独特遗忘模式,代码模型均已开源。
LightMem用3招重新设计了LLM的记忆,结果出乎意料
LLM在超长多轮对话中有上下文窗口有限、记忆系统昂贵的痛点。LightMem借鉴人类记忆机制,用三招重新设计LLM记忆,实验显示其准确率超基线,还降低token使用量、API调用和运行时间。
快手Klear团队提出CE-GPPO:通过梯度保留协调熵,解决强化学习中的熵不稳定问题
快手 Klear 语言大模型团队提出新强化学习算法 CE - GPPO,以「熵」为核心,提出梯度保留策略,重新利用裁剪外区间低概率 token 的梯度,实现策略熵的精细调控,解决强化学习中熵不稳定问题。
西湖大学打造了一个AI科学家,突破人类SOTA,还能自己发论文
西湖大学文本智能实验室推出能自主探索的AI科学家DeepScientist,两周完成人类三年科研量。它在三个前沿AI任务刷新SOTA纪录,还能写论文。文中介绍其科研历史、工作方式、成果及面临的伦理问题。
DPad: 扩散大语言模型的中庸之道,杜克大学陈怡然团队免训推理加速61倍
扩散大语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克大学陈怡然团队揭示其“草稿纸机制”,提出免训练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍推理加速。