「多模态处理」共找到 1792 篇相关文章
微软分享三大王炸算法:突破大模型推理瓶颈,性能大涨
今天凌晨微软官网分享三大创新算法,即rStar - Math、LIPS、CPL,可助大模型突破推理瓶颈,增强数学推理和思考链能力,还介绍了各算法原理、优势及对应论文地址。
Anthropic的多智能体,真的有必要吗?
作者曾质疑多智能体系统,看了Anthropic对「Claude Research」的说明后有了改观。介绍了多智能体系统定义、性能提升、代价,还阐述构建方法、评估方式,公开三个核心提示词及协作模式。
聊聊AI应用架构演进
本文按AI应用架构演进路线,介绍每次演进增加的架构内容及相关技术,涵盖从简易架构到Agent模式等各阶段,还提及监控、推理性能优化等,助读者整理新技术,为探讨AI与传统应用架构异同做调研。
Alibaba开源WebDancer解决DeepResearch复杂信息检索难题
Alibaba开源WebDancer,从数据和训练阶段出发提出端到端自主信息检索代理构建范式。实验中,它在GAIA和WebWalkerQA基准测试表现出色,处理复杂信息检索优势显著。
字节开源了一个了不得的模型!
字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。
大模型系统提示词逆向(2)—— Cursor
作者研究大模型提示词注入时,用简单提示词“骗”出 Cursor 系统提示词。文中分析提示词生效原理、对 Cursor 有效的原因,还提及提示词泄露的安全问题及开发者应对建议。
字节跳动&清华大学开源多模态时序大模型ChatTS,可实现时序数据对话与推理
字节跳动与清华合作开源多模态时序大模型ChatTS,可实现时序数据对话与推理。它用合成数据训练,解决了数据稀缺等问题,在评估中表现远超基线模型,未来可拓展至更高阶任务。
3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!
文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在多个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。
OpenAI官方发布【Codex 上手指南】
OpenAI 昨晚推出 Codex 研究预览版,这是强大的远程编码智能体,能导航代码库、解答疑问等。官方还发布使用指南视频,介绍了快速上手步骤、工作方式,以及提升效能的方法。
近5w颗星!一个能同时指挥多个AI写代码的开源工具来了
现在写代码,很多人想开多个AI助手。Orca是支持多AI Agent的编程开发环境,各Agent在独立git worktree里运行,互不干扰。它功能丰富,还支持多系统安装。