「长文本优化」共找到 2129 篇相关文章
谷歌Gemini火力全开!实测:原生图像生成新升级确实强
谷歌Gemini原生图像生成功能升级,图像质量更好、文本渲染更准、生成速度更快。可融合图片元素、实时编辑等,能免费试玩,开发者可集成API。实测表现惊艳,也有翻车情况,还能搭配Gemini 2.5 Pro。
ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键
ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。
PDL 在 SGLang Kimi K3 中的应用
文章介绍 PDL 在 SGLang Kimi K3 中的应用,K3 内核优化接入 PDL 以缩短相邻内核间隙。分析 PDL 原理、在 bs=1 decode 中解决的问题,阐述计算链和通信链上的应用,还提及性能数据和实现问题。
不用人类手写训练框架了!AI自己写代码,训出1B端侧「小钢炮」
5月25日,面壁开源端侧文本基座大模型MiniCPM5 - 1B,主打低成本部署等。它由AI编写的ForgeTrain框架参与预训练,效果与英伟达Megatron对齐且速度快10%。该模型在榜单表现优,应用边界广,部署门槛低。
Qwen3.7:智能体新前沿
阿里云正式发布面向智能体时代的Qwen3.7-Max模型,将通过API提供服务。它能力全面,编程、办公、长周期执行等表现出色,适配多框架,在多场景评测中领先,能驱动生产力跃升,还经多实战测试验证实力。
行为记忆+认知记忆,中科大MemWeaver重构LLM个性化记忆
论文MemWeaver被The Web Conference 2026接收,它聚焦用户从隐式到显式文本交互时个性化生成的升级问题。提出将用户历史升级为层次化记忆,构建行为与认知双记忆模块,主实验表现优,消融实验验证其结构设计关键。
你不知道的 Agent:原理、架构与工程实践
文章聚焦 Agent 架构中影响工程效果的关键内容,如控制流、上下文工程等。介绍 Agent 基本运转方式、控制模式,强调 Harness 比模型更关键,还阐述上下文工程、工具设计、记忆系统等要点,并以 OpenClaw 为例说明落地方法。
OCR 发生了一件反直觉的事
百度 PaddleOCR 团队的 500 万参数模型 PP - OCRv5,在文字识别准确率上可与 Qwen3 - VL、GPT - 4o 等巨无霸模型抗衡。团队挑战‘模型越大,效果越好’,认为 OCR 中数据质量比参数重要,通过实验证明并优化数据。
Datadog 如何将其 Agent 的 Go 二进制文件缩减 77%
5 年里 Datadog Agent 从 428 MiB 增至 1.22 GiB,其工程师着手缩减二进制文件大小。发现膨胀主因是隐藏依赖等,采取审计导入项等措施,借助工具优化,还减少反射和插件使用,6 个月实现缩减且未移除功能。
为什么BF16的FlashAttention会把训练「炸掉」?清华首次给出机制解释,用极简改动稳住训练
社区里长期存在的FlashAttention+BF16训练GPT - 2时loss突然爆炸的问题,清华团队论文给出机制解释。指出是特定条件下数值偏置被放大所致,还给出极小修改稳定训练,且在多模型和硬件上验证有效。