「实例级上下文理解」共找到 1427 篇相关文章
NeurIPS 25开新坑:145万个图文对,覆盖八种主流水下理解任务
华中科技大学团队推出首个水下多模态大模型NAUTILUS,支持8种水下场景理解任务,还开源145万图文对的NautData数据集。模型通过VFE模块解决水下图像问题,性能超越现有模型,恶劣环境表现更佳。
DeepSeek开源新模型,提出上下文光学压缩:LLM的新记忆方式
DeepSeek开源OCR模型,探索用多少视觉信息让LLM理解文本。实验表明1000字文档约需100个vision tokens,压缩比10倍、准确率97%。还提出模拟人类遗忘等想法,有多种应用场景,且完全开源。
不是幻觉!Claude自下指令甩锅人类,百万上下文沦为降智重灾区
Claude深陷「角色混淆」Bug,分不清自己的话与用户指令,长上下文成了降智「重灾区」。开发者Gareth Dwyer记录了该bug,研究发现问题出在底层架构的角色标记缺陷。学术界也关注此问题,整个行业需系统性应对。
代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈
ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。
号称1200万token上下文的模型来了,数据亮眼但疑点重重
当地时间5月5日,Subquadratic公司推出模型SubQ,称是LLM智能重大突破,有1200万token上下文。数据亮眼,如在1M token场景比FlashAttention快52倍等,但也引发质疑,有人推测是对开源模型微调,官方未公布详细模型卡。
NVIDIA开源“Banana”级黑科技!会懂物理、理解时间的图像编辑模型!
继谷歌Banana后,英伟达开源物理级图像编辑模型ChronoEdit - 14B,被称‘NVIDIA版的Banana’。它有‘时间观念’和‘物理常识’,能按描述生成符合物理规律图像,适用于多领域。
DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案
DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。
深刻理解Token:大语言模型(LLM)是如何看待这世界?
文章指出在大语言模型(LLM)中,Token是处理文本的基本单位。介绍了Token的概念、分词方法、向量化过程,还阐述了分词对模型性能的影响,如导致模型在数学、多语言处理上表现不佳等。
大模型也需要睡觉!让AI打个盹,醒来更聪明
卡内基梅隆大学和马里兰大学研究发现,大模型处理长上下文易累傻。受人脑机制启发,设计睡眠机制,让模型在上下文窗口快满时打盹,反复咀嚼信息,压缩进长期权重。测试显示,增加“睡眠”轮次能提升深度推理表现。
从上下文工程到 AI Memory,本质上都是在「拟合」人类的认知方式
文章结合胡塞尔现象学,探讨从上下文工程到AI Memory,指出它们本质在‘拟合’人类认知。介绍二者概念及构建方法,对比人类与AI记忆异同,还通过与胡塞尔对话,思考AI意识等哲学问题。