「多任务能力」共找到 7296 篇相关文章
狂肝一周,测评十余款 PPT AI 生成产品的真实反馈
评估 Agent 产品能力复杂,以 PPT 生成为例,有 Agent 和模板化两种流派。作者选前者投票测评、后者全方位测试。给出方案,还推荐不同需求适用产品,附总榜单和细致体验描述。
智能体的致命三要素及六种安全设计模式
智能体发展带来诸多安全问题,仅靠外部防护不合理。Simon Willison总结其致命三要素,指出间接提示词注入攻击难防。Invariant Labs等提出六种安全设计模式,可综合使用,多LLM方法值得关注。
深度体验|京东开源轻量化通用Agent产品 jdgenie,开箱即用!二次开发及踩坑指南。
本文体验京东开源的端到端多智能体系统JoyAgent - JDGenie,它是产品级多智能体协同系统,开箱即用、支持本地部署。介绍其原理架构、本地部署测试步骤、二次开发方式,还指出特点与不足。
一夜之间OpenAI神秘模型“o3-alpha”刷爆时间线:远胜 Claude Sonnet
OpenAI神秘新模型“o3-alpha”正在测试,刷爆时间线。早期测试显示其性能超强,能一键生成游戏,前端编码能力远胜Sonnet、o3等。有猜测它是AHC模型或OpenAI将开源的模型。
这个推理模型:HRM ,只用2700万参数,超越了DeepSeek和Claude
Sapient Intelligence研究者受大脑机制启发提出分层推理模型HRM,它是全新循环架构,仅2700万参数、1000个训练样本,就在复杂推理任务上表现卓越,还引入近似梯度等方法,有推动通用计算变革潜力。
视觉感知RAG × 多模态推理 × 强化学习 = VRAG-RL
数字化时代视觉信息愈发重要,传统RAG方法处理视觉信息面临挑战。阿里巴巴通义实验室的VRAG - RL将强化学习引入多模态智能体训练,革新检索生成范式,提升视觉语言模型多方面能力,代码已开源。
PDF/DOCX/HTML/扫描文档接卸不再愁!D自动解析文档并统一格式的开源库edoc
Dedoc是开放通用系统,能将文档转换为统一格式,提取逻辑结构和内容。用Python实现,支持多种格式,有可扩展性等优势,还能处理扫描文档,可用于多个系统,介绍了安装方法。
仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!
剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。
高潮从第几秒开始?GaMMA 让多模态大模型真正「听懂」音乐时间线
现有多模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在多基准上表现优异,刷新 SOTA。
π0.7发布,VLA押出了机器人的GPT-3时刻
今天凌晨,Physical Intelligence发布VLA模型π0.7,首次在机器人领域证明组合泛化。它用多样化prompt处理多样数据,涌现多种能力,还证明数据过滤可能是伪问题,架构基于前作,推动VLA回归。