「Token压缩」共找到 811 篇相关文章
Hugging Face 发布 FineTranslations:一个万亿级的多语言平行文本数据集
Hugging Face 发布 FineTranslations,这是含超 1 万亿 Token 的多语言数据集,用于提升机器翻译质量。它源于 FineWeb2,用 Gemma3 27B 翻译创建,数据生成流程可复现公开,还能用在其他任务。
人大高瓴赵鑫团队新作:先拆掉 RLVR,再重建推理模型训练
人大高瓴赵鑫团队围绕RLVR框架做系统实验,完成论文《A3PO: Adaptive Asymmetric Advantage Shaping for Reasoning Models》,提出A3PO方法。该方法将训练重点转向关键决策点,让推理模型学习更可控。
Agent上下文工程被Cursor玩出了新高度~
Cursor的agent为所有模型使用动态上下文,在保持质量时更智能填充上下文。代码Agent改变软件开发方式,Cursor提出动态上下文发现模式,介绍了在其中使用该模式的做法及优势。
谷歌 Gemini API 负责人自曝:用竞品Claude Code 1小时复现自己团队一年成果,工程师圈炸了!
谷歌主管工程师 Jaana Dogan 称,用竞品 Claude Code 一小时就生成了接近自己团队一年成果的系统。她公开评价引发争议,也让大家思考‘一年工程 vs 一小时生成’背后被压缩的是什么。
MCP可能并不必须!
在大家将MCP奉为Agent工具协议标准时,Mario Zechner博文提出不同观点,认为很多情况下无需MCP。作者结合自身经验认同此观点,分析了MCP现实困境,介绍简单替代方案及优势。
推理效率狂飙60倍:DiDi-Instruct让扩散大模型16步超越千步GPT
普渡大学等研究者提出 DiDi-Instruct 后训练方法,可将扩散大语言模型推理加速 60 倍,超越传统 GPT 模型。该方法实现推理效率与效果双提升,为大语言模型落地提供新方案。
Karpathy 评 DeepSeek-OCR:分词器必须消失!马斯克:光子才是 AI 的终极语言
Andrej Karpathy 发长文讨论 DeepSeek - OCR 论文,提出图像输入比文本更高效,还表达对分词器的厌恶,认为其必须消失。马斯克称 AI 主要交互将是视觉。开发者分享实践经验,也有人提出质疑。
真够卷的!DeepSeek更完智谱更:GLM-4.6,代码国内最强
前脚DeepSeek更新到V3.2,智谱又推出GLM-4.6,代码能力达国内最强。测试显示其在多方面表现出色,还降低平均token消耗。寒武纪、摩尔线程跟进适配,价格也降低。
Kimi K2发布两天即“封神”?80%成本优势追平Claude 4、打趴“全球最强AI”,架构与DeepSeek相似!
国内独角兽月之暗面发布开源模型 Kimi K2,推出两天就在 OpenRouter 超越 xAI 的 Grok 4。它成本优势大,能力泛化和实用性强,编码、Agent 工具调用等方面表现出色,架构与 DeepSeek 相似。
2025上半年大模型使用量观察:Gemini系列占一半市场份额,DeepSeek V3用户留存极高
推特博主「karminski - 牙医」基于OpenRouter数据,分析2025年上半年大模型API市场,涵盖总Token使用量、市场份额、细分领域用量、API接口使用趋势等,得出各模型表现及市场格局的观察结论。