「长文本优化」共找到 2119 篇相关文章
Qoder 发布首个自进化的智能体:看 Quest 如何重构了 Quest
Qoder 发布首个自进化智能体 Quest,它能自主完成重构自身长程任务执行逻辑等任务。Quest 从上下文管理、工具选择、Agent Loop 三方面优化架构,还具备自主进化能力,正探索自主编程新可能。
注意力机制大变革?Bengio团队找到了一种超越Transformer的硬件对齐方案
Transformer虽改变世界但不完美,线性递归等新方法理论有优势,实际在GPU表现不佳。Bengio团队提出硬件对齐算法框架,用滑动窗口循环和B2P算法,实验显示有速度与质量双重突破。
GraphRAG圈新秀:文档级RAKG
随着大模型能力增强,知识图谱成研究热点。传统KGC有实体消歧难、模式僵化等痛点。文章提出RAKG框架,将RAG评估机制引入知识图谱构建,实现文档级自动化构建与评估,多指标表现优异。
Being-VL的视觉BPE路线:把「看」和「说」真正统一起来
北大、UC San Diego 和 BeingBeyond 联合提出 Being-VL 的视觉 BPE 路线,先将图像离散化并「分词」,再与文本统一建模,能缩短跨模态链路、保留视觉结构先验,还介绍了实现步骤、训练方式等。
Who’s Adam?最逆天的NeurIPS评审出炉了
这两天大家收到NeurIPS 2025评审结果,网上现逆天评审意见,把Adam优化器当成拼写错误。投稿量飙升致审稿质量难保证,AI评审成普遍现象,还推荐了写反驳意见的博客。
ACL 2025 | AI字幕慢半拍,不知道大家在笑什么?新方法让同传性能直逼离线翻译
香港中文大学、字节跳动Seed和斯坦福大学团队提出SeqPO - SiMT框架解决同声传译“质量 - 延迟”权衡问题。该方法将同传建模为序贯决策过程,优化决策序列,实验显示其性能直逼离线翻译。
SGLang Team:在 96 个 H100 GPU 上部署具有 PD 分解和大规模专家并行性的 DeepSeek
本文介绍 SGLang 团队在 96 个 H100 GPU 上部署 DeepSeek 的方法。利用 PD 分解和大规模专家并行性,SGLang 实现高吞吐量,成本低。博客探讨并行设计、优化方法,所有组件开源,也指出了当前局限与未来方向。
AI浪潮之下:存储来到聚光灯下
AI浪潮下,行业对存储设备重视上升。其根因是AI业务刺激,数据量增长且推理业务有新需求。信通院报告显示我国存力结构优化,国内厂商迎来机会,平头哥镇岳510主控芯片表现出色,生态建设也在推进。
AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?
研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。
ChatGPT:再见「破折号」
常使用AI的人会发现,模型爱用破折号,成了检测AI文本的土办法。OpenAI CEO Sam Altman称已解决ChatGPT爱用破折号问题,按指令它会照做,但评论区有人反馈破折号仍存在。