「长文本模型」共找到 8027 篇相关文章
一个模型千万个灵魂!Anthropic找到了防止AI陷入疯狂的防线
Anthropic和牛津大学研究发现,大模型的AI助理角色易在长对话中漂移崩塌,致其陷入幻觉。研究解析助理轴,揭示模型人格定位,还提出激活上限技术,能在保能力的同时降低有害回复率。
让外部知识“长入”模型:动态化与参数化 RAG 技术探索
检索增强生成(RAG)成大语言模型利用外部知识主流范式,但传统方法将其当黑箱,忽略动态需求和机制鸿沟。艾清遥博士介绍动态化和参数化检索增强技术,可提升准确性与适应性,减少计算开销。
Qwen3新成员:Embedding系列模型登场!
今天正式发布Qwen3-Embedding系列模型,专为文本表征等任务设计,继承Qwen3多语言理解优势。在多项基准测试表现卓越,已在多平台开源,有卓越泛化性、灵活架构与多语言支持等特点。
警惕!大模型成本倒挂:你正在为模型的多余「思考」买单
一项来自多所高校和微软研究院的研究揭示AI模型价格倒挂现象,低定价模型可能产生更高实际开销。研究聚焦8个前沿推理模型和9个主流数据集,指出推理token是成本倒挂主因,且实际开销难以预测。
用 1/1000 的参数打穿大模型:我为什么强烈推荐 PaddleOCR
PaddleOCR是百度开源的OCR工具,模型参数仅0.07B,却能在复杂场景媲美大模型精度。其新一代PP - OCRv5全面升级,在文本检测等方面表现出色,还稳定增长且在海外受关注。
“通用大模型微调成为行业模型是伪命题”?医疗 AI 深度重构,传神语联创始人何恩培:孪生智能体能砍 70% 线下复诊工作
本文为《2025年度盘点与趋势洞察》系列内容,传神语联创始人何恩培认为通用大模型微调成行业模型是伪命题。他表示孪生智能体能砍70%线下复诊工作,还分享了医疗AI发展、中医和西医落地方向及突破方向等见解。
百度搜索 10 年来最大改版,支持超千字长文本输入和 MCP 调用
7月2日,百度搜索宣布十年来最大改版,搜索框变“智能框”,支持超千字输入,集成AI写作等功能。“百看”功能、AI助手升级,接入视频生成模型MuseSteamer,还接入1.8万+MCP,提升搜索体验。
文本已死,视觉当立!Karpathy狂赞DeepSeek新模型,终结分词器时代
DeepSeek新成果DeepSeek - OCR以像素处理文本,压缩率小于1/10,基准测试领跑,开源一夜获4.4k星。Karpathy力挺,认为应赶走分词器,展望视觉成通用输入前景,马斯克有更科幻猜想。
万帧?单卡!智源研究院开源轻量级超长视频理解模型Video-XL-2
长视频理解是多模态大模型关键能力,当前开源模型有短板。智源研究院联合发布 Video-XL-2,多维度优化长视频理解能力,还设计效率优化策略,在主流评测基准表现出色,有广泛应用潜力。
实测Qwen-MT翻译模型,确实又快又好
阿里云百炼最新翻译模型Qwen-MT开放,有支持多语言互译、提供专业功能、轻量级架构等亮点。实测显示其响应快、回译准确、能调风格,200字文本仅需2.5秒。