「复杂文档处理」共找到 1959 篇相关文章
上科大何旭明团队新作:克服简单样本偏置,让多模态模型学会「难题优先」
上海科技大学何旭明团队针对多模态模型幻觉问题,提出DA-DPO框架。该方法不依赖额外人工标注,通过动态调整样本权重,缓解简单样本偏置,在降低幻觉率同时提升综合能力,具成本效益。
把RoPE扔掉,AI更能看懂长上下文!Transformer作者团队开源大模型预训练新方法
Transformer架构核心作者之一Llion Jones团队开源新技术DroPE,可丢弃位置嵌入扩展上下文,解决RoPE长序列处理缺陷,在多模型实验中表现卓越。该团队来自Sakana AI,此前还有相关研究成果。
从组件到 OS 的跃迁,MemOS 深度拆解:构建企业级 Agent 的高性能记忆底座【上】
本文深入剖析开源记忆方案MemOS,它将记忆从“外挂组件”升为“系统资源”。介绍其设计理念、核心架构,分析记忆需加工、分层调度和治理的原因,还阐述记忆三态及流转,最后展示MemOS Cloud的使用方法。
利用Loop语言模型扩展隐式推理 | 直播预约
当前大语言模型依赖显式文本生成推理,未充分利用预训练数据。将介绍最新工作Ouro,Loop语言模型家族,核心创新多,虽参数少却性能优,还会讨论其推理轨迹及模型Scaling新可能。
AI视频生成平台
酷模Cumob AI是基于Next.js构建的AI内容生成平台,集成多AI服务提供商API,有漫画生成等工作流,具备并发处理、资源管理等优化,支持多种部署,有诸多功能特性与亮点。
还在手搓PPT?试完这款AI,我连夜卸载了付费模板库
新智元报道,今年AI从「卷分数」变为「卷干活」。商汤升级的「办公小浣熊3.0」是超级「办公搭子」,能做PPT、分析数据、写报告。其APP即将上线,还实现全链路国产化适配。
阿里重磅开源 0.5B TTS + 0.8B ASR,支持跨语种音色克隆、说唱识别!
2025 年 AI 圈风向变了,开始卷端侧模型。阿里 FunAudioLLM 团队发布 Fun - CosyVoice3 0.5B 和 Fun - ASR - Nano 0.8B,TTS、ASR 双线程开源,是工程级版本,目标是在本地跑顺‘听 + 说’。
AI翻译的「最后一公里」
文章指出文化差异成AI翻译难题,通用大模型数据不平衡,存在“算法霸权”。如处理低资源语言,AI易产生幻觉,还因无肉身难理解基于生理体验的隐喻,人机协作才是翻译未来。
不想再折腾 ELK?上手体验,程序员自建监控新选择,前端埋点 + 后端日志 + 链路追踪,一套开源栈全包了
OpenObserve 是云原生开源观测平台,用一个服务搞定日志、指标等监控与可视化,能解决监控栈散、部署复杂、存储贵的问题,号称日志存储成本比 ES 降至约 1/140,功能亮点多。
中心动态重分配哈希,北邮团队提出并开源CRH项目 | AAAI 2026
北京邮电大学等机构联合提出新颖端到端框架 CRH,在训练哈希函数时动态更新哈希中心,提升检索精度和语义一致性。论文被 AAAI 2026 收录,代码已开源。