「多模态系统」共找到 2520 篇相关文章
Claude Agent Skills:从第一性原理深入剖析
本文深入剖析Claude的Agent Skills系统,它是基于提示的元工具架构,借助‘提示展开’与‘上下文改写’扩展大模型能力。文中以具体技能为例,介绍其机制、构建方法、编写规范及常见模式。
Kubernetes 引入后量子支持的 TLS
Kubernetes推出增强功能,通过与KMS插件系统集成的混合密钥交换机制支持后量子密码学,应对量子计算对加密协议的威胁,确保系统能随密码学标准演变灵活适应,此举措符合相关建议。
GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”
智源研究院发布国产开源统一图像生成模型OmniGen 2.0版本。它增强理解与生成能力,打通多模态生态。玩法简单,技术有创新,还引入反思机制和新基准,推理效率提升,且将全面开源。
小展直击爆款毕设幕后!AI 能偷走人类的艺术灵魂?
最近AI绘画风很大,有人喊“人类要失业”,但郭奕彤带着《合成图像家庭》站出来打脸。他用碳笔勾勒‘毕加索版’大耳朵图图,让AI‘打辅助’,还给电视装‘随机盲盒’系统定制影像。
AI自己写代码做科研还跑赢了前沿算法?清华团队开源Alchemy框架
清华团队开源 Alchemy 框架,它是面向自动化 AI 科研的标准化研究环境,能让 AI Scientist 摆脱工程负担,专注算法创新,还支持多领域、多任务,具有多种特性,在多模态推荐任务中表现出色。
警告:你的Agent可能无法"解决"真实世界的视觉问题
文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。
北大、蚂蚁三个维度解构高效隐私保护机器学习:前沿进展+发展方向
北大李萌课题组与蚂蚁集团研究者共同完成综述,从协议、模型和系统三个维度梳理隐私保护机器学习(PPML)领域,指出当前痛点,给出优化策略,还提出跨层级协同优化方向。
创智突破:AI首次自主发现106个超越人类设计的神经网络架构
创智学院团队发布的AI超智能系统ASI - ARCH,自主发现106个超越人类设计的神经网络架构,建立“科学发现缩放定律”,实现从“自动化优化”到“自动化创新”转变,还将成果开源推动研究发展。
感知错误率降低30.5%:隐式感知损失让模型主动“睁大眼睛” | UIUC&阿里通义
伊利诺伊大学香槟分校与阿里通义实验室推出多模态推理强化学习算法PAPO。它用隐式感知损失设计,解决感知与推理脱节问题,在多基准测试中表现优,但有KL_prcp Hacking现象。
充分激发模态协作,MokA量身打造MLLM微调新范式
当下多模态大模型微调多「照搬」单模态微调策略,忽视模态差异。中国人民大学和上海人工智能实验室团队提出 MokA 方法,兼顾单模态与跨模态建模,在多基座、多场景实验中显著提升性能。