长上下文困境」共找到 1349 篇相关文章

开源动态8

Hugging Face开源顶级模型:双模式推理+128K上下文,最强3B

今天凌晨,Hugging Face开源顶级小参数模型SmolLM3,参数30亿,性能超同类。它有128k上下文窗口,支持6种语言、双推理模式。架构细节等全开放,联合创始人强烈推荐,称是3B领域SOTA。

AIGC开放社区
开源动态8

面向时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni

文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。

GitHubStore
算法论文8

与DeepSeek-OCR不谋而合,NeurIPS论文提出让LLM像人一样读文本

NeurIPS 2025 论文提出 VIST 框架,为大语言模型文本推理提供视觉方案,与 DeepSeek - OCR 理念不谋而合。它模仿人类阅读,有快 - 慢路径协作,在多任务表现优,还让模型‘用眼看文字’,优势明显。

机器之心
算法论文8

小红书RecSys 2025最佳论文提名背后:破解视频时预测难题

小红书推荐算法团队论文《Multi-Granularity Distribution Modeling for Video Watch Time Prediction via Exponential-Gaussian Mixture Network》在 RecSys 2025 获最佳论文提名。该文剖析视频时预测难题,提出 EGMN 模型,线下线上验证效果佳。

机器之心
算法论文8

X上63万人围观的Traning-Free GRPO:把GRPO搬进上下文空间学习

年初 DeepSeek - R1带火大模型强化学习,GRPO成常见RL算法,但训练成本高。腾讯优图论文提出Training - Free GRPO,将GRPO训练范式迁移到上下文学习,成本低、泛化好,已开源。

机器之心
推荐文章7

架构师困境:选择已被验证的道路,还是自行开辟一条新路?

开发软件时,团队要做产品功能和架构决策,面临选已验证路径还是自辟新路的困境。使用平台和框架虽能加快开发,但有副作用。团队需通过实验判断何时扩展或替换平台。

InfoQ
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极大值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。

机器之心
开源动态8

攻克结构化文档检索难题!新框架让模型告别“结构性失明”

SEAL团队推出全新对比学习框架SEAL,通过带结构感知和元素对齐,将文档宏观层级结构和微观元素语义融入Embedding空间,提升模型对结构化数据的理解。在BGE - M3模型上提升了MRR@10指标,还开源了万级字数文档数据集。

量子位
算法论文8

破解MoE模型“规模越大,效率越低”困境!中科院自动化所提出新框架

大模型参数量飙升却陷入‘规模越大,效率越低’困境,中科院自动化所研究团队提出统一框架,直击MoE底层运作模式,让专家‘组队学习’,实现参数量、负载方差降低,达成三重优化。

量子位
算法论文8

大模型越反思越错,原来是链推理通过自我说服加重幻觉 | 北邮

北邮研究团队通过思维链审计实验,揭示大模型链推理‘越想越错’现象背后的元认知偏差。研究基于RFC协议文档构建受控知识域,分析推理过程,发现反思会加重幻觉,且现有检测方法难以应对。

量子位