「多场景隔离」共找到 5328 篇相关文章
深度体验|京东开源轻量化通用Agent产品 jdgenie,开箱即用!二次开发及踩坑指南。
本文体验京东开源的端到端多智能体系统JoyAgent - JDGenie,它是产品级多智能体协同系统,开箱即用、支持本地部署。介绍其原理架构、本地部署测试步骤、二次开发方式,还指出特点与不足。
何恺明评审,谢赛宁获奖!牛津华人博士生拿下CVPR 2025最佳论文
CVPR 2025奖项揭晓,投稿量增13%,接收率22.1%。最佳论文来自牛津与Meta AI,提出新前馈网络。还公布年轻研究者等多奖项,何恺明任最佳论文评审。
PDF/DOCX/HTML/扫描文档接卸不再愁!D自动解析文档并统一格式的开源库edoc
Dedoc是开放通用系统,能将文档转换为统一格式,提取逻辑结构和内容。用Python实现,支持多种格式,有可扩展性等优势,还能处理扫描文档,可用于多个系统,介绍了安装方法。
通义实验室新研究:大模型自己「扮演」搜索引擎,提升推理能力无需搜索API
阿里通义实验室开源ZeroSearch,提供无需与真实搜索引擎交互的强化学习框架。它用模拟搜索环境和渐进式抗噪训练,让LLM自给自足,节省API成本,在多问答数据集表现优,为智能化检索提供新思路。
85倍速度碾压:苹果开源FastVLM,能在iphone直接运行的视觉语言模型
苹果开源能在 iPhone 上运行的视觉语言模型 FastVLM,代码仓库含 iOS/macOS 演示应用。它速度快,首个 token 输出速度较同类模型提升 85 倍,还兼容主流 LLM,适合边缘设备等场景。
GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉
清华教授、智谱唐杰在𝕏征集GLM下个版本意见,浏览量达40w+。此前他有求必应,网友热情参与。这次评论区多要视觉能力,因GLM-5.2是纯文本模型,而对手多为多模态。
高潮从第几秒开始?GaMMA 让多模态大模型真正「听懂」音乐时间线
现有多模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在多基准上表现优异,刷新 SOTA。
打字太慢?2026年开发者语音输入终极指南:12款工具横评,找到最适合你的那一个
文章是 2026 年开发者语音输入工具横评。指出 AI 编程时代语音输入成刚需,介绍 12 款工具优缺点、适用场景和价格,还给出使用技巧,作者分享自己的选择组合。
「听觉」引导「视觉」,OmniAgent开启全模态主动感知新范式
针对端到端全模态大模型痛点,浙江大学、西湖大学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在多基准测试中超越开闭源模型。
AI Coding后端开发实战:解锁AI辅助编程新范式
文章指出AI Coding应用中开发者存在认知误区,基于实践为后端开发者提供使用指导。涵盖个人上下文管理、输出质量判断等内容,介绍核心使用流程,涉及项目开发、脚本处理等场景及最佳实践。