「多模态长文档问答」共找到 1302 篇相关文章
夯,开源 LiteParse,没有对手的 PDF 解析工具,知道的太晚了!
LlamaIndex团队开源独立工具LiteParse,用Rust打造,可本地运行、零成本、高精度解析PDF。它能提取文本及精确位置,有多种输出格式,支持多格式输入,还介绍了安装、使用、OCR配置等内容及应用场景。
谷歌神秘模型Kingfall泄漏!
近日,谷歌AI模型Kingfall在AI Studio平台短暂开放后意外曝光。它具备多模态处理能力,上下文窗口6.5万个token,有两种模式。生成SVG矢量图能力超Claude 4,身份猜测不断。
突发!姚顺雨后,清华95后庞天宇加入腾讯,任混元「首席科学家」
继OpenAI大神姚顺雨之后,95后清华博士庞天宇入职腾讯,任混元首席研究科学家,负责多模态强化学习。腾讯AI战略从跟随转向进攻,人才、技术、架构都有新动作。
ICME专题征稿 | 具身多模态智能:从感知到世界建模
ICME是多媒体领域国际顶级会议,2026年将在泰国曼谷举行。此次专题征稿聚焦具身多模态智能,涵盖多模态感知、世界模型等主题,介绍了投稿详情及联系方式。
OpenMAIC:一键生成互动课堂,视频+PPT全都有,还可以编辑
清华开源项目OpenMAIC是多智能体互动课堂,上传文档或描述主题,几分钟就能生成虚拟课堂,AI教授讲课、同学讨论,还有白板功能。底层用LangGraph编排,支持主流模型,有OpenClaw集成,架构完整。
给大家看看,2025年用AI开会的新姿势。
作者回顾用AI开会的旧方式,指出2025年用飞书开会有新变化。会议纪要可视化,图文并茂、按进度分类,还纳入重要图片;搭配知识问答功能,会议信息成企业知识库,检索方便。
SRO赋能Qwen-2.5-VL推理性能飙升16.8%
文本领域推理模型成就大,但多模态大型语言模型推理能力扩展遇阻,如冷启动初始化不足等。提出SRO三阶段训练框架,经测试,ReVisual - R1平均性能提升16.8%。
商汤新模型 SenseNova-U1 Pro 曝光,对标 GPT-Image-2,瞄准「设计」赛道
商汤科技在股东大会预告下一代旗舰多模态基座模型 SenseNova-U1 Pro,预计 2026 年 7 月邀测,对标 GPT-Image-2,瞄准「设计」赛道,具备多核心能力,还支持 8K 分辨率输出。
SRO架构赋予Qwen-2.5-VL推理能力,性能飙升16.8%
文本领域推理模型成就大,但扩展到多模态大语言模型遇阻力,如冷启动初始化不足等。为此提出 SRO 三阶段训练框架,经测试,ReVisual - R1 平均性能提升 16.8 个百分点。
谷歌放大招了,开源命令行AI编程Agent,每天1000次免费调用,编程只是基础功能。
Google推出开源命令行AI编程Agent——Gemini CLI,基于Gemini 2.5 Pro模型,免费提供每日1000次调用额度。它不仅能编程,还具备多模态能力、实时信息整合等功能,支持定制与自动化。